Распознать текст в PDF: работа со сканами
Откроем «Распознать текст в PDF» и посмотрим, из чего складывается результат. Суть проста: сделайте скан PDF доступным для поиска с помощью распознавания текста. Обработка идёт на сервере после загрузки. Заберите результат в течение 60 минут. Начните с копии. Оригинал пусть лежит отдельно до конца. Сравните, каким файл был и каким стал. Рост без причины — остановитесь. Если файл для людей — гляньте итог на другом устройстве. Откройте результат в другой программе для контроля. Начните с компактного файла для пробы. Подозрительный итог — повод сменить параметры. Сверяйте итог с исходником по первым и последним строкам.
- Оригинал — в сторону, вся работа — на копии.
- Зайдите на страницу и загрузите готовый файл.
- Укажите язык документа. От него зависит точность распознавания.
- Перед стартом гляньте настройки. Мелочь решает многое.
- Нажмите кнопку запуска. Дождитесь сообщения о готовности.
- Скачайте вывод и сличите с оригиналом по страницам.
В петербургского издательства Марина собирает договор из трёх сканов. Листы идут вразнобой, один перевёрнут. Марина выравнивает порядок, поворачивает страницу и сохраняет единый файл. Оглавление и ссылки проверяются отдельно. Итог уходит юристу Татьяна на согласование. Павел кладёт копию для архива в общую папку. Марина подтверждает, что цифры в порядке. Перед отправкой Павел ещё раз открывает итог на телефоне. Проверку Павел повторяет утром свежим взглядом. Итоговый файл Павел называет по дате, чтобы не потерять. Спорный фрагмент Марина показывает коллеге. Папку с проектом Павел закрывает описью. Павел записывает дату и номер в журнал.
Замерьте размер до — и после. Выросший небольшой файл лучше заменить оригиналом. Пары 0/O и 1/I — отдельная проверка. Увеличьте страницы с мелкими символами. Сверка ключевых цифр с оригиналом не помешает. Проверьте таблицы: шапки, первые и последние строки, итоги. Заберите файл до истечения 60 минут. Число страниц и порядок — по оригиналу. Убедитесь, что ссылки и оглавление ведут куда нужно. Пролистайте итоговый файл до конца. Готовый результат «Распознать текст в PDF» откройте и просмотрите целиком.
На сколько страниц хватает распознавания?
За раз распознаётся не больше 10 страниц. Язык документа задайте верно. Чистый скан — точный результат.
Можно ли обойтись без потерь качества?
Небольшое сжатие дают служебные данные. Для изображений потери обычны. Без глазной проверки итог не годится.
Сколько страниц берётся за проход?
Проход держит до 30 страниц. Толстый документ — по частям. Выбор вида 1,3-5 отмечает нужные страницы.
Какие файлы сравниваются?
Два PDF объёмом до 10 МБ и 30 страниц каждый. Различия подсвечиваются. Пустые страницы ищутся в том же пределе.
Что делать с файлом, закрытым паролем?
Разблокируйте его заранее, если имеете право. Чужие защиты обходить нельзя. Запароленные копии инструмент не принимает.