Research·Europe

Alte OCR-Texte lassen Sprachmodelle nur mit 30 Prozent der Effizienz lernen – das FineBooks-Projekt will das ändern

Global AI Watch · Editorial Team··4 min read
Alte OCR-Texte lassen Sprachmodelle nur mit 30 Prozent der Effizienz lernen – das FineBooks-Projekt will das ändern
Redaktionelle Einschätzung

By 2027, expect open-source models to significantly enhance AI training using historical datasets, increasing model accuracy and reducing costs.

Kernpunkte

  • 1Das FineBooks-Projekt von Hugging Face und EleutherAI hat 14 offene OCR-Modelle an über 2000 historischen Buchseiten getestet.
  • 2Das beste Modell, dots.mocr, erreicht 97,6 Prozent Zeichengenauigkeit bei unter zwei Dollar pro tausend Seiten.
  • 3Für KI-Trainingsdaten reicht das, für wissenschaftliche Transkriptionen bisher nicht.
  • 4Der Artikel Alte OCR-Texte lassen Sprachmodelle nur mit 30 Prozent der Effizienz lernen – das FineBooks-Projekt will das ändern erschien zuerst auf The Decoder.

Das FineBooks-Projekt von Hugging Face und EleutherAI hat 14 offene OCR-Modelle an über 2000 historischen Buchseiten getestet. Das beste Modell, dots.mocr, erreicht 97,6 Prozent Zeichengenauigkeit bei unter zwei Dollar pro tausend Seiten. Für KI-Trainingsdaten reicht das, für wissenschaftliche Transkriptionen bisher nicht. Der Artikel Alte OCR-Texte lassen Sprachmodelle nur mit 30 Prozent der Effizienz lernen – das FineBooks-Projekt will das ändern erschien zuerst auf The Decoder.

Free Daily Briefing

Top AI intelligence stories delivered each morning.

Subscribe Free →

Explore Trackers