Как сделать сканированный PDF с поиском: OCR или извлечение текста

pdf, ocr, сканы, поиск

Если в PDF нельзя выделить фразу и поиск в просмотрщике не находит слово, не спешите конвертировать файл в Word или TXT. Сначала определите, есть ли внутри текстовый слой. От этого зависит нужный инструмент:

Что происходит с PDFЧто делать
Текст выделяется и ищетсяИспользовать PDF в текст, если нужен отдельный TXT
Страницы выглядят как фотографии, поиск пустойЗапустить OCR для PDF и получить PDF с поиском
На руках отдельные фото страницСначала собрать их в сканере документов, затем при необходимости запустить OCR
Текст ищется, но в нём много ошибокВ файле уже есть слабый OCR; обычное извлечение его не исправит

Проверка за минуту

Откройте PDF в обычном просмотрщике и найдите редкое слово с первой страницы: фамилию, номер договора или название организации. Затем попробуйте выделить одну строку мышью.

Если выделяется именно текст, а не прямоугольная область страницы, слой уже есть. Для простого экспорта в TXT откройте PDF в текст: он прочитает существующий слой локально в браузере. Инструмент не делает OCR, поэтому скан без текстового слоя вернёт сообщение об отсутствии текста, а не выдуманный результат.

Если страница выбирается как картинка, нужен OCR. Он анализирует изображение, распознаёт символы и добавляет к странице невидимый текстовый слой. Внешний вид скана обычно сохраняется, но текст уже можно искать, выделять и копировать.

Как получить PDF с поиском

  1. Откройте распознавание PDF.
  2. Выберите язык: русский, английский или русский + английский.
  3. Загрузите один сканированный PDF и дождитесь обработки.
  4. Скачайте PDF с поисковым текстовым слоем.
  5. Откройте результат и найдите по поиску фамилию, дату и одно слово с мелким шрифтом.

Распознавание выполняется на сервере: файл отправляется pdfy по HTTPS, а исходник и результат удаляются после обработки. Для текущего инструмента действуют ограничения 20 МБ, 15 страниц и 180 секунд. Если документ нельзя передавать внешнему сервису по правилам компании, используйте согласованный локальный OCR на рабочем компьютере.

Что влияет на качество OCR

Лучше всего распознаётся ровный контрастный скан с достаточным разрешением, без смаза, теней и сильного наклона. Просвечивающая обратная сторона и рукописные пометки тоже увеличивают число ошибок.

Если исходники ещё не собраны в PDF, обработайте их в сканере документов: расставьте страницы, обрежьте поля, поверните кадры и настройте яркость или контраст. Этот этап работает локально и не распознаёт текст. Он только готовит более аккуратный PDF, который затем можно передать в OCR.

Особенно внимательно проверяйте:

  • фамилии, адреса и артикулы;
  • даты, суммы, десятичные разделители;
  • О/0, З/3, I/l/1 и похожие символы;
  • таблицы и текст в нескольких колонках;
  • страницы с печатями, подписями и слабым фоном.

PDF с поиском удобен, но не является подтверждением точности. Если данные пойдут в договор, отчёт или таблицу с расчётами, сверяйте их с изображением страницы.

Когда нужен не OCR

Для PDF, в котором текст уже выделяется, OCR добавляет лишний этап и может ухудшить копирование. Сразу используйте извлечение в TXT.

Если цель — перенести таблицу в Excel, после распознавания понадобится отдельная конвертация и ручная проверка структуры. В разборе как вытащить таблицу из PDF в Excel показано, почему видимая сетка ещё не означает настоящие ячейки.

Перед закрытием задачи проверьте три вещи: поиск на первой и последней странице, копирование строки с кириллицей и критичные числа. Такой тест быстрее показывает слабый OCR, чем беглый просмотр всего документа.

Частые вопросы

Как понять, что PDF является сканом?
Попробуйте выделить фразу или найти заметное слово через поиск в просмотрщике. Если страница ведёт себя как одна картинка и поиск ничего не находит, в файле, скорее всего, нет текстового слоя.
Чем OCR отличается от извлечения текста из PDF?
Извлечение читает уже существующий текстовый слой и может сохранить его в TXT. OCR распознаёт буквы на изображениях и добавляет к скану новый поисковый слой.
OCR в pdfy работает локально?
Нет. Инструмент распознавания отправляет PDF на сервер pdfy по HTTPS. Исходный файл и результат удаляются после обработки. Обычное извлечение существующего текста в TXT работает локально в браузере.
Станет ли распознанный PDF полностью редактируемым?
Нет. Результат — PDF с распознанным текстовым слоем для поиска и копирования. Это не восстановленный DOCX, а ошибки в именах, номерах и таблицах всё равно нужно проверять.

Связанные инструменты