staging.inyokaproject.org

[gscan2pdf] OCR - Sprachen für Tesseract wird nicht angezeigt

Status: Gelöst | Ubuntu-Version: Ubuntu 12.04 (Precise Pangolin)
Antworten |

atreiju

Anmeldungsdatum:
21. Dezember 2007

Beiträge: Zähle...

Hallöchen,

Habe gscan2pdf und tesseract-ocr-deu installiert. Leider kann ich aber bei der Auswahl von der OCR-Software in gscan2pdf nur "English" auswählen, andere Sprachen nicht ☹ Brauche aber mindestens noch "Deutsch".

Wie bringe ich gscan2pdf bei, dass ich auch die deutsche Sprachdatei für tesseract installiert habe?

Danke & Grüße, Atreiju.

moses_johann

Avatar von moses_johann

Anmeldungsdatum:
27. Juni 2007

Beiträge: 135

Hallo Liebe Gemeinde,

grabe den alten Beitrag nochmals aus, da ich genau das Problem habe und es damals beim Threadersteller nicht gelöst wurde.

Habe bereits versucht, tesseract-ocr-deu vor der Neuinstallation von gscan2pdf zu installieren, hat nichts gebracht. Weiß jemand, wo man das einstellen muss, dass auch deutsch auswählbar ist?

Screenshot: http://s7.directupload.net/images/140117/nf4d5njc.png

Heinrich_Schwietering Team-Icon

Wikiteam
Avatar von Heinrich_Schwietering

Anmeldungsdatum:
12. November 2005

Beiträge: 11335

Hi!

Schaut mal ins Wiki, in den gcan2pdf-Artikel, das Problem ist bekannt, Lösung unter Precise ist die Nutzung einer Version ab 1.0.4, z.B. aus dem PPA des Entwicklers.

so, long
hank

Win-nie

Anmeldungsdatum:
26. Januar 2014

Beiträge: Zähle...

die OCR Funktionalität von gscan2pdf mit tesseract-deu sollte in die ubuntu Standard Repositories eingebunden sein. Die Einrichtung von Backdoors sind ein Sicherheitsrisiko, wie in jedem Ubuntu WIKI zu lesen ist.

Heinrich_Schwietering Team-Icon

Wikiteam
Avatar von Heinrich_Schwietering

Anmeldungsdatum:
12. November 2005

Beiträge: 11335

Hi!

@ Win-nie Erstmal: Willkommen im Forum!

Aber dann: Mal langsam... Die entsprechenden Pakete kannst du ohne "Backdoor" aus dem PPA des gscan2pdf-Autors beziehen, du brauchst das PPA nicht mal einzubinden, sondern kannst dir das entsprechende Paket auch so herunterladen.

Ab Version 12.10 sind die verwendeten gscan2pdf-Version auch in der Lage, alle installierten tesseract-Sprachen zu erkennen.

Dass es in 12.04 in den Repos keine aktuelleren Versionen gibt, liegt am Ubuntu-Konzept, dass die Software in den einzelnen Ubuntu-Versionen nur dann aktualisiert wird, wenn es gravierende Sicherheitsprobleme gibt (z.B. Sicherheitslücken in Browsern, in Java o.ä.) Dass gscan2pdf in der zum Erscheinungstermin vorliegenden Version Probleme mit der Erkennung von tesseract-Sprachen hat, ist allerdings kein Sicherheitsrisiko, insofern wird es auch keine gscan2pdf-Version in den 12.04-Repos geben, die dieses Problem behebt.

so long
hank

Win-nie

Anmeldungsdatum:
26. Januar 2014

Beiträge: Zähle...

moin Hank, danke für die Info und danke thanx for the warm welcome...Das ändert jedoch nichts an meiner Aussage bzgl. Sicherheit. Ist der Code schlecht programmiert, bedeutet dies eine Sicherheitslücke. Für die beiden paranoiden Menschen auf dieser Welt (Snowden und mich) stellt das ein Problem dar.

Win-nie

Anmeldungsdatum:
26. Januar 2014

Beiträge: 5

abgesehen davon, geht es nicht. Selbst gscan2pdf v.1.2.2 erkennt keine pdf Dateien, die er dann per tesseract in text umwandeln könnte. Bei einem Blick in die ubuntu Hilfeseiten wird deutlich, dass das alles irgendwie Baustellle ist...Tja muss ich wohl die windows Partition nehmen...

Heinrich_Schwietering Team-Icon

Wikiteam
Avatar von Heinrich_Schwietering

Anmeldungsdatum:
12. November 2005

Beiträge: 11335

Hi!

"Schlecht programmiert" ist nicht gleich "Sicherheitslücke" - was für finstere Gefahren drohen denn wohl, weil ein Programm nur englische tesseract-Sprachunterstützung hat? Mach dich nicht lächerlich 😉.

Wie soll gscan2pdf PDF-Dateien "erkennen"? Es ist eigentlich dazu gemacht, welche zu erstellen. Hast du Probleme, PDF-Dateien in gscan2pdf zu importieren? Wenn ja, was sind das für Dateien? Und was hat das mit der tesseract-Sprachunterstützung zu tun?

"Alles irgendwie Baustelle" macht irgendwie nicht so klar, was dein Problem in diesem Zusammenhang ist, Respekt aber dafür, dass du das mit einem Blick in die "Ubuntu-Hilfeseiten" erkennst... Empfehle dir daher erstmal Richtig Fragen. Hoffentlich hilft es dir, dein Anliegen etwas präziser zu formulieren.

so long
hank

Win-nie

Anmeldungsdatum:
26. Januar 2014

Beiträge: 5

Oh ja! Super! Rechthabereidiskussion. Vorab. Du hast Recht, in jeder Hinsicht. Doch hier meine Einwände:

Der Verweis auf "Richtig Fragen" ist ein post mehr, aber redundant, warum? Weil alles in diesem thread steht. Und scan2pdf Zudem habe ich keine Lust stundenlang selbst auszuprobieren. Im Folgenden mal ein Beispiel, wie man in Saucy tesseract zum Laufen bekommen kann. Abschnitt "Hinweis" unter tesseract-ocr. Na dann viel Spaß...

dann: gscan2pdf Abschnitt: "Einschränkungen in Ubuntu 12.04/12.10" [...] Die Version 0.9.32 von gscan2pdf erkennt allerdings momentan (September 2012) nur die englische Sprachdatei dazu. Auch OCRopus ist, da es auf tesseract 2.0x basiert, nicht mehr in den Paketquellen verfügbar. Die Texterkennung funktioniert für deutschsprachige Texte auch mit Cuneiform in gscan2pdf nicht zufriedenstellend. Abhilfe schafft momentan nur die Verwendung der aktuellen Version aus dem PPA, damit werden alle installierten Tesseract-Sprachen erkannt. Version 1.0.4, unter Ubuntu 12.10 in den Quellen, hat da keine Probleme, Cuneiform funktioniert aber gar nicht (siehe Cuneiform-Linux - Probleme unter Quantal).

gscan2pdf kann pdfs öffnen, also sollte da auch ein ocr auch möglich sein. Klappt übrigens auf einem LTS Debian stable... 🙄

Heinrich_Schwietering Team-Icon

Wikiteam
Avatar von Heinrich_Schwietering

Anmeldungsdatum:
12. November 2005

Beiträge: 11335

Hi!

@ Win-nie: Schaust du bitte Richtig Fragen wirklich genau an?

Dort steht unter anderem auch, dass zu jedem Thema in eigener Thread eröffnet werden soll, "threadhijacking" ist im Forum nicht erwünscht.

Hier vermischst du nämlich etliches. Geht es dir um tesseract unter saucy? Geht es dir darum, dass gscan2pdf bei dir keine PDFs öffnet? Geht es dir um "backdoors"?

In diesem Thread hier geht darum, dass gscan2pdf unter Presice in der Version aus den Ubuntu-Repos keine tesseract-Sprachen außer Englisch erkennt, und eine mögliche Lösung hab ich dazu auch gepostet...

Eröffne bitte zu deinem konkreten Problem (und das ist mir zumindest momentan nicht klar) einen eigenen Thread - Danke!

so long
hank

Win-nie

Anmeldungsdatum:
26. Januar 2014

Beiträge: 5

Ok, danke für den Hinweis bzgl. Hijacking von threads, wobei ich mir dessen nicht bewusst war. Im Übrigen, funktioniert es jetzt, warum, weiß ich nicht.

moses_johann

Avatar von moses_johann

Anmeldungsdatum:
27. Juni 2007

Beiträge: 135

Lösung zum ursprünglichem Problem:

Installieren von gscan2pdf aus den Entwickler-Quellen http://gscan2pdf.sourceforge.net/, dann klappts auch mit der deutschen Erkennung 😉

Im Detail:

1
2
3
4
gscan2pdf deinstallieren (wenn bereits installiert) - deutsches tesseract-Sprachpaket kann erhalten bleiben
sudo apt-add-repository ppa:jeffreyratcliffe/ppa - Repository hinzufügen
sudo apt-get update - Neue Quellen laden
sudo apt-get install gscan2pdf tesseract-ocr-deu

Fertig ☺

Heinrich_Schwietering Team-Icon

Wikiteam
Avatar von Heinrich_Schwietering

Anmeldungsdatum:
12. November 2005

Beiträge: 11335

Hi!

Jo, genau das hatte ich oben vorgeschlagen, und so stehts auch im Artikel... 😉

so long
hank

Antworten |