Какая программа подходит для поиска отсканированных PDF-файлов?
Я хотел бы иметь возможность сканировать бумажные документы в файлы PDF и делать текст доступным для поиска. Я считаю, что программа Tesseract может помочь в этом, но не знаю, с чего начать, и не знаю, какую программу лучше всего использовать.
Кто-нибудь успешно создает PDF-файлы с возможностью поиска?
1 ответ
Могу порекомендовать, см. https://github.com/ocrmypdf/OCRmyPDF , также упакованный для Ubuntu. Вы можете установить его, запустив:
sudo apt install ocrmypdf
Вы можете использовать его следующим образом:
ocrmypdf -l eng infile.pdf outfile.pdf
The ocrmypdfвызов выше является простым, в котором языком документа является английский (-l eng). Есть много вариантов вmanстраница ; Возможно, вы захотите обнаружить их по мере необходимости с течением времени.