Как сделать сканированный PDF с поиском: OCR или извлечение текста
Если в PDF нельзя выделить фразу и поиск в просмотрщике не находит слово, не спешите конвертировать файл в Word или TXT. Сначала определите, есть ли внутри текстовый слой. От этого зависит нужный инструмент:
| Что происходит с PDF | Что делать |
|---|---|
| Текст выделяется и ищется | Использовать PDF в текст, если нужен отдельный TXT |
| Страницы выглядят как фотографии, поиск пустой | Запустить OCR для PDF и получить PDF с поиском |
| На руках отдельные фото страниц | Сначала собрать их в сканере документов, затем при необходимости запустить OCR |
| Текст ищется, но в нём много ошибок | В файле уже есть слабый OCR; обычное извлечение его не исправит |
Проверка за минуту
Откройте PDF в обычном просмотрщике и найдите редкое слово с первой страницы: фамилию, номер договора или название организации. Затем попробуйте выделить одну строку мышью.
Если выделяется именно текст, а не прямоугольная область страницы, слой уже есть. Для простого экспорта в TXT откройте PDF в текст: он прочитает существующий слой локально в браузере. Инструмент не делает OCR, поэтому скан без текстового слоя вернёт сообщение об отсутствии текста, а не выдуманный результат.
Если страница выбирается как картинка, нужен OCR. Он анализирует изображение, распознаёт символы и добавляет к странице невидимый текстовый слой. Внешний вид скана обычно сохраняется, но текст уже можно искать, выделять и копировать.
Как получить PDF с поиском
- Откройте распознавание PDF.
- Выберите язык: русский, английский или русский + английский.
- Загрузите один сканированный PDF и дождитесь обработки.
- Скачайте PDF с поисковым текстовым слоем.
- Откройте результат и найдите по поиску фамилию, дату и одно слово с мелким шрифтом.
Распознавание выполняется на сервере: файл отправляется pdfy по HTTPS, а исходник и результат удаляются после обработки. Для текущего инструмента действуют ограничения 20 МБ, 15 страниц и 180 секунд. Если документ нельзя передавать внешнему сервису по правилам компании, используйте согласованный локальный OCR на рабочем компьютере.
Что влияет на качество OCR
Лучше всего распознаётся ровный контрастный скан с достаточным разрешением, без смаза, теней и сильного наклона. Просвечивающая обратная сторона и рукописные пометки тоже увеличивают число ошибок.
Если исходники ещё не собраны в PDF, обработайте их в сканере документов: расставьте страницы, обрежьте поля, поверните кадры и настройте яркость или контраст. Этот этап работает локально и не распознаёт текст. Он только готовит более аккуратный PDF, который затем можно передать в OCR.
Особенно внимательно проверяйте:
- фамилии, адреса и артикулы;
- даты, суммы, десятичные разделители;
О/0,З/3,I/l/1и похожие символы;- таблицы и текст в нескольких колонках;
- страницы с печатями, подписями и слабым фоном.
PDF с поиском удобен, но не является подтверждением точности. Если данные пойдут в договор, отчёт или таблицу с расчётами, сверяйте их с изображением страницы.
Когда нужен не OCR
Для PDF, в котором текст уже выделяется, OCR добавляет лишний этап и может ухудшить копирование. Сразу используйте извлечение в TXT.
Если цель — перенести таблицу в Excel, после распознавания понадобится отдельная конвертация и ручная проверка структуры. В разборе как вытащить таблицу из PDF в Excel показано, почему видимая сетка ещё не означает настоящие ячейки.
Перед закрытием задачи проверьте три вещи: поиск на первой и последней странице, копирование строки с кириллицей и критичные числа. Такой тест быстрее показывает слабый OCR, чем беглый просмотр всего документа.
Частые вопросы
- Как понять, что PDF является сканом?
- Попробуйте выделить фразу или найти заметное слово через поиск в просмотрщике. Если страница ведёт себя как одна картинка и поиск ничего не находит, в файле, скорее всего, нет текстового слоя.
- Чем OCR отличается от извлечения текста из PDF?
- Извлечение читает уже существующий текстовый слой и может сохранить его в TXT. OCR распознаёт буквы на изображениях и добавляет к скану новый поисковый слой.
- OCR в pdfy работает локально?
- Нет. Инструмент распознавания отправляет PDF на сервер pdfy по HTTPS. Исходный файл и результат удаляются после обработки. Обычное извлечение существующего текста в TXT работает локально в браузере.
- Станет ли распознанный PDF полностью редактируемым?
- Нет. Результат — PDF с распознанным текстовым слоем для поиска и копирования. Это не восстановленный DOCX, а ошибки в именах, номерах и таблицах всё равно нужно проверять.