Research·Europe
Alte OCR-Texte lassen Sprachmodelle nur mit 30 Prozent der Effizienz lernen – das FineBooks-Projekt will das ändern
Global AI Watch · Editorial Team··4 min read

Redaktionelle Einschätzung
By 2027, expect open-source models to significantly enhance AI training using historical datasets, increasing model accuracy and reducing costs.
Kernpunkte
- 1Das FineBooks-Projekt von Hugging Face und EleutherAI hat 14 offene OCR-Modelle an über 2000 historischen Buchseiten getestet.
- 2Das beste Modell, dots.mocr, erreicht 97,6 Prozent Zeichengenauigkeit bei unter zwei Dollar pro tausend Seiten.
- 3Für KI-Trainingsdaten reicht das, für wissenschaftliche Transkriptionen bisher nicht.
- 4Der Artikel Alte OCR-Texte lassen Sprachmodelle nur mit 30 Prozent der Effizienz lernen – das FineBooks-Projekt will das ändern erschien zuerst auf The Decoder.
Das FineBooks-Projekt von Hugging Face und EleutherAI hat 14 offene OCR-Modelle an über 2000 historischen Buchseiten getestet. Das beste Modell, dots.mocr, erreicht 97,6 Prozent Zeichengenauigkeit bei unter zwei Dollar pro tausend Seiten. Für KI-Trainingsdaten reicht das, für wissenschaftliche Transkriptionen bisher nicht. Der Artikel Alte OCR-Texte lassen Sprachmodelle nur mit 30 Prozent der Effizienz lernen – das FineBooks-Projekt will das ändern erschien zuerst auf The Decoder.
Free Daily Briefing
Top AI intelligence stories delivered each morning.