post
Ich glaub tesseract verwendet gar keine neuronalen Netze oder doch?
https://static.googleusercontent.com/media/research.google.com/de//pubs/archive/33418.pdf
Eine Definition "Neuronale Netze" = KI gibt es nicht. Andere mathematische Methoden der heuristischen Mustererkennung könnte man genauso als KI bezeichnen oder eben beides nicht. Die meisten assoziieren moderne Deep Learning Systeme mit KI, aber eine feststehenden Definition ist das nicht. Liegt auch daran, dass schon für "Intelligenz" selbst verschiedene Definitionen existieren und das auch eher schwammig ist.
Laut LIESMICH ab version 4 schon:
Tesseract 4 adds a new neural net (LSTM) based OCR engine which is focused on line recognition, but also still supports the legacy Tesseract OCR engine of Tesseract 3 which works by recognizing character patterns.
So blöd es klingt und ich tesseract eigentlich mag, die Erkennung ist oft nicht sehr gut. Die kommerzielle Lösung von Adobe hat da mehr auf dem Kasten.
pdfsandwich macht das recht zuverlässig und benutzt intern auch tesseract. Vermutlich mit besseren Parametern.
Gerade ausprobiert. (Musste erst ein wenig in etc rumspielen, weil imagemagick wohl nicht genug rechte zum bearbeiten von pdfs hat) Das Ergebnis ist tatsächlich besser. Allerdings bin ich nur an der Textausgabe interessiert und nicht an einer durchsuchbaren pdf.
Dafür nehme ich pdftotext (glaube Teil von poppler).
Aber für dich wäre es vermutlich schlauer über debug modus, /proc/.../cmdline oder quellcode die settings für tesseract rauszufinden, die pdfsandwich verwendet, damit du dein frontend entsprechen konfigurieren kannst.
Welche OCR (KI) Anwendung hast du da denn verwendet?
Steht dort, Tesseract. https://github.com/tesseract-ocr/tesseract
Edith: Oh, oder meinst du die GUI?
all 16 comments