Recunoașterea optică a caracterelor este acum utilizată pentru scanarea chitanțelor, verificarea identității, automatizarea facturilor, digitalizarea arhivelor istorice și aplicațiile de notițe bazate pe stylus. Se preconizează că piața OCR va ajunge la 32.90 miliarde de dolari până în 2030, cu o rată anuală compusă (CAGR) de 14.8% (Grand View Research, 2024), recunoașterea inteligentă a caracterelor - ramura OCR pentru citirea scrisului de mână - crescând cel mai rapid. Indiferent dacă construiți o analiză de documente, detectarea textului scenelor sau transcrierea scrisului de mână, setul de date OCR pe care îl utilizați vă stabilește plafonul de precizie. Acest ghid acoperă 22 de seturi de date OCR gratuite, open-source - inclusiv cele mai bune seturi de date despre scrisul de mână - organizate după cazuri de utilizare și actualizate cu cele mai puternice lansări până în 2024.
Intrebari cu cheie
- OCR (recunoaștere optică a caracterelor): tehnologie care transformă imagini cu text tipărit, scenic sau scris de mână în date lizibile de mașină.
- Seturile de date OCR sunt împărțite în cinci grupuri: document/formular, text scenă, cifră/caractere, scriere de mână și multilingv.
- Seturi de date OCR pentru documente capturați pagini structurate precum formulare și chitanțe; seturi de date scenă-text capturați text „din natură”.
- IAM, MNIST, ICDAR și SROIE rămân cele mai citate criterii de referință OCR în cadrul cercetărilor.
- Termenii licenței variază foarte mult — verificați fiecare set de date OCR înainte de instruirea comercială.
Ce este OCR (Optical Character Recognition)?
OCR este o tehnologie care convertește diferite tipuri de documente, cum ar fi documente de hârtie scanate, PDF-uri sau imagini de text, în date editabile și căutate. Funcționează prin:
- Analizarea structurii textului dintr-o imagine
- Împărțirea textului în rânduri și caractere
- Conversia acestor caractere vizuale în text care poate fi citit de mașină
Utilizările comune includ:
- Conversia documentelor scanate în fișiere text editabile
- Digitalizarea cărților tipărite
- Extragerea textului din fotografii
- Conversia rețetelor scrise de mână în text digital
- Recunoașterea numerelor de înmatriculare
Cum alegi setul de date OCR potrivit?
Alegerea unui set de date OCR depinde de patru factori: tipul de text, mediul de captură, granularitatea adnotărilor și licența. OCR-ul documentelor tipărite necesită date de antrenament diferite față de textul cursiv scris de mână sau textul curbat al scenelor. Seturile de date pentru documente sunt potrivite pentru facturi, formulare și chitanțe; seturile de date pentru textul scenelor sunt potrivite pentru semnalizare și citirea produselor; seturile de date pentru scrierea de mână sunt potrivite pentru notițe, manuscrise și introducerea cu stylus. Adnotările la nivel de cuvânt și la nivel de linie acceptă canale OCR complete, în timp ce seturile la nivel de caracter se potrivesc cu liniile de bază de clasificare. Confirmați întotdeauna termenii licenței, deoarece unele seturi de date OCR sunt destinate exclusiv cercetării sau necesită înregistrare.
Care sunt cele mai bune seturi de date OCR pentru documente și formulare?
Seturile de date OCR pentru documente antrenează modelele să analizeze pagini structurate, cum ar fi facturi, formulare, chitanțe și ID-uri. Acestea stimulează automatizarea documentelor de afaceri și extragerea cheie-valoare.
- FUNSD — 199 de formulare scanate adnotate, cu aspect real, cu zgomot. Standardul de referință pentru înțelegerea formularelor și extragerea cheie-valoare.
- SROIE — Set de date ICDAR 2019 privind chitanțele scanate, cuprinzând aproximativ 1,000 de chitanțe, care permit detectarea textului, recunoașterea și extragerea informațiilor într-un singur set.
- CORDON — Un set de date consolidat privind chitanțele, creat pentru analiza post-OCR, cu etichete bogate la nivel de câmp pentru automatizarea facturilor și a chitanțelor.
- XFUND — Extensie multilingvă a FUNSD care acoperă șapte limbi (germană, spaniolă, franceză, italiană, japoneză, portugheză, chineză) cu câte 199 de pagini fiecare. Ideală pentru inteligența artificială multilingvă pentru documente.
- DDI-100 — Aproximativ 100,000 de imagini distorsionate ale documentelor pentru detectare și recunoaștere în condiții reale de degradare, cum ar fi asimetrie, neclaritate și zgomot.
Care sunt cele mai bune seturi de date OCR pentru textul scenelor?
Seturile de date OCR scenă-text antrenează modelele să citească text în imagini naturale, cum ar fi semne, produse și scene stradale. Acestea sunt esențiale pentru OCR practic, unde fundalurile sunt aglomerate.
- Citire robustă ICDAR — Familia de referințe din spatele majorității cercetărilor privind textele scenelor, inclusiv provocările legate de Textul Scenelor Focalizat și Incidental cu casete de încadrare la nivel de cuvânt și transcrieri.
- COCO-Text — Adnotări textuale la scară largă, stratificate pe imagini MS-COCO. Puternic pentru detectarea textului la scară largă în scene naturale.
- Text total — Se specializează în text curbat și orientat arbitrar, un punct slab cunoscut al modelelor OCR mai vechi.
- SVT (Text Street View) — Imagini Word colectate din Google Street View, adesea cu rezoluție redusă și variabilitate ridicată. Disponibile prin intermediul oglinzilor Papers with Code.
- HierText — Adnotare ierarhică de la paragraf la rând și la cuvânt, acoperind atât textul scris de mână, cât și cel tipărit. Utilă pentru OCR care ține cont de aspect.
Care sunt cele mai bune seturi de date OCR pentru cifre și caractere?
Seturile de date OCR pentru cifre și caractere antrenează modelele să recunoască simboluri individuale în setări controlate. Acestea sunt punctele de plecare standard pentru liniile de bază pentru clasificare.
- MNIST — 70,000 de imagini cu cifre scrise de mână în tonuri de gri. Cea mai rapidă bază pentru validarea unui clasificator de cifre.
- EMNIST — Extinde MNIST cu 814,255 de litere și cifre scrise de mână, derivate din baza de date specială NIST 19.
- SVHN (Numere de casă Street View) — Peste 600,000 de imagini cu cifre din lumea reală, provenite de la numere de case. O îmbunătățire practică a MNIST pentru condiții zgomotoase.
- Caractere74K — 74,107 imagini care acoperă caractere englezești și kannada din imagini naturale și fonturi de calculator.
- Baza de date specială NIST 19 — Peste 810,000 de imagini cu personaje imprimate manual de la 3,600 de scriitori. Sursa din care provin multe teste de OCR în limba engleză.
Care sunt cele mai bune seturi de date despre scrierea de mână pentru OCR?
Seturile de date despre scrierea de mână antrenează modelele OCR să citească text cursiv, tipărit și text scris de mână istoric. Cele mai puternice seturi de date despre scrierea de mână deschisă rămân cele mai citate repere pentru recunoașterea textului scris de mână (HTR).
- Baza de date IAM pentru scrierea de mână — Standardul de aur pentru scrisul de mână în limba engleză, cu 13,353 de rânduri de text de la 657 de scriitori. Încă este setul de date privind scrisul de mână cel mai citat în cercetarea OCR din 2024–2025.
- IAM-OnDB — Versiunea online a IAM pentru utilizarea traiectoriei, care captează date despre traiectorie. Setul canonic de date privind scrierea de mână pentru recunoașterea stylusului și a tabletei.
- Documentele Bentham — Transcrieri ale manuscriselor istorice englezești de la filosoful Jeremy Bentham. Referința principală pentru OCR pentru scrierea de mână istorică, accesibilă prin Transkribus.
- GNHK (Kolecția de Scriere de Mână GoodNotes) — Un set de date din 2021 cu notițe scrise de mână în limba engleză, fără restricții, din lumea reală. Mai aproape de datele de producție dezordonate decât de IAM-ul curat de laborator.
Care sunt cele mai bune seturi de date OCR multilingve și nelatine?
Seturile de date OCR multilingve antrenează modele pe alfabete dincolo de engleză, inclusiv chineză, arabă și notație matematică. Acestea sunt esențiale pentru recunoașterea globală a documentelor și a scrisului de mână.
- CASIA-HWDB — Standardul chinezesc pentru OCR, cu 1.17 milioane de mostre de caractere scrise de mână de la 1,020 de scriitori.
- KHATT — 1,000 de formulare arabe scrise de mână de la 1,000 de autori diferiți, scanate la rezoluții multiple. Cel mai cuprinzător set de date OCR deschis pentru caractere arabe.
- CROHME — Concurs de recunoaștere a expresiilor matematice scrise de mână online: peste 10,000 de expresii în peste 101 simboluri matematice, atât în variante online, cât și offline. Esențial pentru OCR-ul ecuațiilor scrise de mână.
Care sunt capcanele comune atunci când se utilizează seturi de date OCR gratuite?
Trei capcane prind majoritatea echipelor.
Nepotrivire de domeniu: antrenarea pe IAM sau COCO-Text curate și implementarea pe facturi mototolite garantează o precizie slabă.
Cecitate cu licențe: mai multe seturi de date OCR istorice și cu text de scenă sunt destinate exclusiv cercetării sau necesită înregistrare înainte de utilizarea comercială.
Lacune în adnotări: multe seturi de date OCR nu au metadatele de aspect, casetele de delimitare la nivel de linie sau etichetele de câmp de care au nevoie sistemele de producție.
Imaginați-vă o firmă de logistică de dimensiuni medii care automatizează citirea etichetelor de expediere. Instruirea cu text public în scenă le aduce la 80% din rezultate la testele de performanță, dar etichetele reale cu strălucire și pliuri le scad la 58%. Eliminarea acestei diferențe a necesitat adnotarea datelor specifice a 6,000 de imagini cu etichete din domeniu înainte de lansare.
Beneficiile și provocările setului de date open-source

Companiile trebuie să pună în față beneficiile și provocările pentru a înțelege dacă trebuie să opteze pentru date gratuite pentru aplicațiile lor ML.
Beneficii
- Datele sunt ușor de accesat. Datorită disponibilității datelor, costul dezvoltării aplicației este redus semnificativ.
- Timpul și efortul petrecut pentru colectarea datelor pentru aplicație sunt reduse semnificativ, deoarece setul de date este ușor disponibil.
- Există o mulțime de forumuri comunitare sau grupuri de ajutor care ajută la învățarea, adaptarea și optimizarea setului de date.
- Unul dintre avantajele majore ale setului de date open-source este că nu impune restricții privind personalizarea.
- Datele open-source sunt accesibile pentru o mare parte a populației, făcând posibile analiza și inovarea fără bariere monetare.
Activități
- Datele specifice proiectului sunt greu de achizitionat. În plus, există posibilitatea de a lipsi informații și de a utiliza incorectă datele disponibile.
- Obținerea datelor proprietare necesită timp și efort și este costisitoare
- Deși ar putea fi mai ușor să obțineți date, costul cunoștințelor și analizei ar putea depăși avantajul inițial.
- Alți dezvoltatori folosesc, de asemenea, aceleași date pentru a dezvolta aplicații.
- Aceste seturi de date sunt foarte vulnerabile la încălcări de securitate, confidențialitate și consimțământ.
Cum susține Shaip proiectele OCR și de recunoaștere a scrisului de mână?
Serviciile de date pentru antrenament OCR oferite de Shaip combină selecția de seturi de date deschise cu colectarea personalizată de date în peste 60 de limbi, acoperind documente tipărite, scris de mână, chitanțe și acte de identitate. Fluxurile de lucru pentru adnotări oferite de Shaip adaugă straturile care lipsesc din seturile de date OCR publice: casete de delimitare la nivel de linie, etichete la nivel de câmp, controlul calității transcrierilor și metadatele scriitorului.
Concluzie
Cele 22 de seturi de date OCR de mai sus vă oferă o bază completă open-source pentru recunoașterea documentelor, a textului scenelor, a cifrelor, a scrisului de mână și a multilingvismului pentru anul 2026. Începeți cu setul de date OCR care se potrivește tipului de text și mediului de captură, validați-l cu un eșantion rezervat din datele reale și alocați un buget pentru adnotări personalizate pentru a acoperi decalajul dintre domenii. Această combinație este disponibilă mai rapid decât construirea de la zero.
Care este cel mai bun set de date OCR gratuit pentru învățarea automată?
Cel mai bun set de date OCR gratuit depinde de sarcina de lucru. ICDAR Robust Reading indică textul scenei, FUNSD și SROIE indică OCR pentru documente și chitanțe, iar IAM indică scrierea de mână. Pentru recunoașterea cifrelor, MNIST și SVHN sunt standard. Majoritatea echipelor combină două sau trei seturi de date OCR din diferite categorii, în loc să se bazeze pe unul singur.
Sunt seturile de date OCR open-source gratuite pentru uz comercial?
Seturile de date OCR open-source nu sunt toate gratuite pentru utilizare comercială. MNIST, SVHN și COCO-Text utilizează licențe permisive, în timp ce seturile IAM, ICDAR și seturile de date istorice privind scrierea de mână necesită adesea înregistrare sau restricționează utilizarea la cercetare. Verificați întotdeauna licența fiecărui set de date înainte de a antrena un model comercial.
Care este diferența dintre seturile de date OCR și seturile de date pentru scrierea de mână?
Seturile de date OCR acoperă toate tipurile de recunoaștere a textului lizibil de mașină, inclusiv documente tipărite, text scenic și cifre, în timp ce seturile de date privind scrierea de mână reprezintă subsetul axat pe conținutul scris de mână. Seturile de date privind scrierea de mână, precum IAM și Bentham, antrenează modele HTR, în timp ce seturile de date OCR pentru documente și text-scenă gestionează text tipărit și text neutilizat.
Ce seturi de date OCR acceptă recunoașterea multilingvă?
Seturile de date OCR multilingve includ XFUND pentru șapte limbi de formulare, CASIA-HWDB pentru chineză, KHATT pentru arabă și ICDAR MLT pentru textul scenelor multilingve. Combinarea seturilor de date OCR specifice scripturilor cu augmentarea sintetică depășește, de obicei, performanța antrenamentului pe orice set de date individual.
De câtă adnotare personalizată am nevoie pe lângă seturile de date OCR gratuite?
Nevoile de adnotare personalizată depind de cât de departe sunt documentele dvs. de datele publice. Formularele tipărite curate pot necesita 1,000-5,000 de mostre în domeniu, în timp ce scrisul de mână dezordonat, chitanțele sau scripturile rare necesită adesea 10,000-50,000. Canalele de adnotare Shaip oferă de obicei o creștere a preciziei de 15-30% față de antrenamentul OCR exclusiv public.