Какая программа подходит для поиска отсканированных PDF-файлов?

Я хотел бы иметь возможность сканировать бумажные документы в файлы PDF и делать текст доступным для поиска. Я считаю, что программа Tesseract может помочь в этом, но не знаю, с чего начать, и не знаю, какую программу лучше всего использовать.

Кто-нибудь успешно создает PDF-файлы с возможностью поиска?

1 ответ

Могу порекомендовать, см. https://github.com/ocrmypdf/OCRmyPDF , также упакованный для Ubuntu. Вы можете установить его, запустив:

      sudo apt install ocrmypdf

Вы можете использовать его следующим образом:

      ocrmypdf -l eng infile.pdf outfile.pdf

The ocrmypdfвызов выше является простым, в котором языком документа является английский (-l eng). Есть много вариантов вmanстраница ; Возможно, вы захотите обнаружить их по мере необходимости с течением времени.

Другие вопросы по тегам