Papyrio
Все конвертеры

OCR PDF

Извлеките текст из сканированных или основанных на изображениях PDF.

Перетащите файл сюда, или выбрать

Сканированный PDF — макс. 50 МБ · занимает 10–30 с

or import from

Как это работает

  1. 1

    Загрузите сканированный PDF или PDF на основе изображений

  2. 2

    Tesseract OCR считывает каждую страницу с разрешением 300 DPI

  3. 3

    Скачайте файл .txt со всем извлечённым текстом

Возможности

  • Движок Tesseract — отраслевой стандарт для OCR
  • Рендеринг 300 DPI для максимальной точности
  • Работает со сканированными документами
  • Без регистрации
  • Файлы удаляются после конвертации

Как сделать отсканированный PDF доступным для поиска

Загрузите отсканированный PDF в Papyrio. Tesseract читает каждую страницу как изображение с разрешением 300 DPI и извлекает найденный текст. Вы скачиваете файл .txt со всем распознанным содержимым — его можно копировать, искать по нему или вставить в редактируемый документ.

Что на самом деле делает OCR

Отсканированный PDF — это фотография страницы, а не текст. В нём нечего выделять, искать или копировать. OCR, оптическое распознавание символов, анализирует изображение, находит очертания букв и превращает их в настоящие символы.

Насколько точен OCR

Точность почти полностью зависит от качества скана. Чистые контрастные сканы с разрешением 300 DPI и выше дают очень точный результат. Ниже 150 DPI буквы размываются и ошибок становится больше, особенно в мелком шрифте.

OCR или извлечение текста: что выбрать

Если в вашем PDF текст уже выделяется, то есть слова можно щёлкнуть и подсветить в обычной программе для чтения, OCR не нужен: используйте инструмент извлечения текста, он быстрее и точнее. OCR нужен только тогда, когда страница является изображением.

Что влияет на качество распознавания

Важнее всего разрешение: сканируйте при 300 DPI, когда это возможно. Перекос страницы тоже ухудшает результат, поэтому выровняйте документ перед сканированием. Высокий контраст между текстом и фоном заметно улучшает распознавание.

Частые вопросы

Что такое OCR?

OCR (оптическое распознавание символов) считывает текст с изображений. Если ваш PDF — скан, OCR извлекает из него текст.

Какой язык поддерживается?

Пока только английский. Поддержка нескольких языков — в наших планах.

Насколько это точно?

Зависит от качества скана. Чёткие документы при 300 DPI дают очень хороший результат.

Сколько это занимает времени?

Примерно 2–3 секунды на страницу. Документ из 10 страниц обрабатывается около 20–30 секунд.