Set de date arabă și thailandeză și vietnameză și hindi și engleză și chineză
Seturi diverse de date de recunoaștere a textului pentru aplicații OCR avansate: panouri, meniuri și multe altele
Caz de utilizare: OCR
Format: Imagine
Număr: 150 mii
Adnotare: Da
Descriere: Set de date pentru limbile arabă, thailandeză, vietnameză, hindi, engleză și chineză
Caz de utilizare: OCR
Format: Imagine
Număr: 1 mii
Adnotare: Da
Descriere: Setul de date cu text arab conține o colecție de exemple de text scrise în limba arabă. Acesta include diverse forme de conținut, cum ar fi articole de știri, postări pe rețelele sociale, literatură și dialoguri, acoperind diferite subiecte și stiluri de scriere. Acest set de date este utilizat pentru sarcini precum procesarea limbajului natural (NLP), clasificarea textului, analiza sentimentelor și traducerea automată în aplicații în limba arabă.
Caz de utilizare: OCR
Format: Imagine
Număr: 38 mii
Adnotare: Da
Descriere: Set de date pentru limbile chineză, engleză, tibetană și uigură
Caz de utilizare: OCR
Format: Imagine
Număr: 60 mii
Adnotare: Da
Descriere: Setul de date privind meniurile în chineză și engleză conține imagini sau exemple de text ale meniurilor restaurantelor care sunt disponibile atât în limbile chineză, cât și în engleză. Acesta include diverse fonturi, machete și structuri de meniu, prezentând denumiri, descrieri și prețuri bilingve ale preparatelor. Acest set de date este util pentru sarcini precum recunoașterea optică a caracterelor (OCR), traducerea automată și digitalizarea meniurilor în medii multilingve.
Caz de utilizare: OCR
Format: Imagine
Număr: 3 mii
Adnotare: Da
Descriere: Setul de date privind compozițiile scrise de mână în limba chineză conține exemple de texte chinezești scrise de mână, inclusiv compoziții, eseuri și alte texte lungi. Acesta prezintă diverse stiluri de scriere de mână și niveluri de complexitate și este utilizat pentru sarcini precum recunoașterea scrisului de mână, analiza textului și antrenarea modelelor de învățare automată.
Caz de utilizare: OCR
Format: Imagine
Număr: 1 mii
Adnotare: Da
Descriere: Setul de date cu solicitări WIFI în limba chineză constă în exemple de text găsite în solicitările WIFI și ecranele de conectare scrise în limba chineză. Acesta include de obicei diverse solicitări, instrucțiuni și mesaje de eroare legate de conectarea la sau gestionarea rețelelor WIFI. Acest set de date este utilizat pentru sarcini precum recunoașterea textului, procesarea limbajului natural și îmbunătățirea interfețelor utilizator pentru conectivitatea la rețea.
Caz de utilizare: OCR
Format: Imagine
Număr: 12 mii
Adnotare: Da
Descriere: Setul de date privind scrierea de mână în limba engleză și chineză conține mostre de scris de mână atât în limba engleză, cât și în limba chineză, prezentând diverse stiluri de scriere și complexități ale caracterelor. Acesta este de obicei utilizat pentru antrenarea și evaluarea modelelor de recunoaștere a scrisului de mână, pentru susținerea analizei textului multilingv și a altor cercetări conexe. Setul de date include o gamă diversă de caractere, cifre, cuvinte și propoziții în ambele limbi.
Caz de utilizare: OCR
Format: Imagine
Număr: 30 mii
Adnotare: Da
Descriere: Setul de date privind semnele comerciale în limba engleză și chineză include imagini cu semne comerciale care conțin atât text în limba engleză, cât și în limba chineză. Acesta surprinde diverse elemente de semnalizare, cum ar fi numele magazinelor, reclamele, promoțiile și indicațiile rutiere, afișate în diverse fonturi, stiluri și formate. Acest set de date este utilizat pentru sarcini precum detectarea și recunoașterea textului, înțelegerea scenelor multilingve și îmbunătățirea modelelor de vedere computerizată pentru interpretarea semnalizării bilingve.
Caz de utilizare: OCR
Format: Imagine
Număr: 50 mii
Adnotare: Da
Descriere: Setul de date pentru text cu unghiuri speciale în engleză și chineză conține imagini cu text afișat în diferite unghiuri și orientări, atât în engleză, cât și în chineză. Acesta include text din surse precum semne, reclame și documente care nu sunt prezentate în formate orizontale standard. Acest set de date este utilizat pentru antrenarea și evaluarea modelelor de detectare și recunoaștere a textului, în special a celor capabile să gestioneze text în orientări și perspective netradiționale.
Caz de utilizare: OCR
Format: Imagine
Număr: 20 mii
Adnotare: Da
Descriere: Setul de date English Menu include imagini sau exemple de text ale meniurilor restaurantelor scrise în limba engleză. Acesta oferă o varietate de fonturi, machete și stiluri de formatare, cu conținut variind de la nume de preparate la descrieri și prețuri. Acest set de date este adesea utilizat pentru sarcini precum recunoașterea optică a caracterelor (OCR), extragerea textului și digitalizarea meniurilor în aplicații legate de alimentație.
Caz de utilizare: OCR
Format: Imagine
Număr: 33 mii
Adnotare: Da
Descriere: Setul de date Text Scene în limba engleză constă din imagini care conțin scene naturale cu text încorporat în limba engleză. Textul apare în diverse forme, cum ar fi semne, panouri publicitare și postere, adesea în fonturi, dimensiuni și orientări diverse. Acest set de date este utilizat în mod obișnuit pentru antrenarea și testarea modelelor în sarcini de detectare, recunoaștere și înțelegere a scenelor din text.
Caz de utilizare: Inteligență artificială pentru documente
Format: HEIC (imagini) și .mov (videoclipuri)
Număr: 94053
Adnotație: Nu
Descriere: Fotografii live cu text scris de mână pentru japoneză, coreeană și rusă
Dispozitiv de înregistrare: Cameră iPhone și iPad
Condiții de înregistrare: - Iluminare/Strălucire agresivă - Bliț aparat foto activat - Lumină colorată - Lumină slabă, fără bliț aparat foto - Normal
Caz de utilizare: OCR
Format: Imagine
Număr: 40 mii
Adnotare: Da
Descriere: Setul de date pentru limbile japoneză și coreeană include exemple de text atât în japoneză, cât și în coreeană. Acesta prezintă o gamă largă de conținut, cum ar fi propoziții, expresii și cuvinte, cuprinzând diverse contexte și stiluri. Acest set de date este utilizat pentru sarcini precum procesarea limbajului natural (NLP), traducerea automată și analiza textului în aplicații multilingve.
Caz de utilizare: Inteligență artificială pentru documente
Format: HEIC (imagini) și .mov (videoclipuri)
Număr: 23930
Adnotație: Nu
Descriere: Fotografii live cu text scris de mână pentru japoneză, coreeană și rusă
Dispozitiv de înregistrare: Cameră iPhone și iPad
Condiții de înregistrare: - Iluminare/Strălucire agresivă - Bliț aparat foto activat - Lumină colorată - Lumină slabă, fără bliț aparat foto - Normal
Caz de utilizare: Text + Audiovizual (Multilingv / OCR / NLP)
Format: Videoclipuri
Număr: peste 100 de videoclipuri cu prelegeri + videoclipuri PPT în format lung
Adnotație: Nu
Descriere: Cărți chinezești, Cărți în engleză, Jurnale, Politici publice, Romane, Copii, Audio+Text cantoneză, Videoclip+PPT pentru prelegeri, Videoclip format lung. Jumătate de miliard de cărți, perechi de întrebări și răspunsuri, articole.
Folosim cookie-uri pentru a vă îmbunătăți experiența pe site-ul nostru. Folosind site-ul nostru, sunteți de acord cu cookie-urile.
Gestionați-vă preferințele cookie mai jos:
Cookie-urile esențiale permit funcțiile de bază și sunt necesare pentru buna funcționare a site-ului.
Google Tag Manager simplifică gestionarea etichetelor de marketing pe site-ul dvs. web fără modificări de cod.
Cookie-urile de statistică colectează informații în mod anonim. Aceste informații ne ajută să înțelegem cum folosesc vizitatorii site-ul nostru.
Google Analytics este un instrument puternic care urmărește și analizează traficul site-ului web pentru a lua decizii de marketing informate.
URL serviciu: policies.google.com (se deschide într-o fereastră nouă)
Cookie-urile de marketing sunt folosite pentru a urmări vizitatorii site-urilor web. Intenția este de a afișa reclame relevante și captivante pentru utilizatorul individual.
Google Ads este o platformă de publicitate online care permite companiilor să creeze reclame direcționate afișate în rezultatele căutării Google și pe site-urile partenerilor.
URL serviciu: policies.google.com (se deschide într-o fereastră nouă)
HubSpot este o platformă multifuncțională de marketing, vânzări și servicii pentru clienți, care simplifică creșterea afacerii.
URL serviciu: legal.hubspot.com (se deschide într-o fereastră nouă)
Puteți găsi mai multe informații în Politica noastră privind cookie-urile și Politica de confidențialitate.