Studiu de caz privind colectarea datelor de vorbire în limba indiană: 300 de ore în hindi, telugu și engleză
A oferit servicii de colectare, transcriere și adnotare a datelor audio de înaltă calitate, pentru a antrena suita lor vocală multilingvă de procesare a vorbirii bazată pe inteligență artificială.
Prezentare generală a proiectului: Date vocale pentru o platformă de localizare în limba indiană
Clientul dezvoltă tehnologii care elimină decalajul lingvistic din lumea digitală. Conținutul din aplicații și portaluri poate fi livrat în mai multe limbi în timp real prin intermediul platformei lor Language-as-a-Service. Platforma lingvistică oferă conținut static și dinamic din aplicații și portaluri în mai multe limbi, în timp real.
Aceștia oferă servicii de localizare lingvistică pentru diverși clienți, cum ar fi mărci de dispozitive mobile, producători de chipset-uri, internet de larg consum, bănci și instituții financiare, instituții de învățământ, guverne, divertisment și multe altele.
Rezultate cheie: 300 de ore acumulate în 3 limbi
Date audio colectate, transcrise și adnotate
300 ore
Nu
Limbă
3 (100 ore x 3 limbi)
Limbi transcrise și adnotate
Engleză indiană, hindi, telugu
Proiect
Companiei
12 săptămâni
Provocarea: Găsirea unui limbaj conversațional divers din punct de vedere demografic
Lipsa accesului la lingviști de calitate, experți în adnotarea datelor și termene stricte au reprezentat un blocaj în progresul și adoptarea inteligenței artificiale conversaționale. Apelarea la lingviști, transcrierea și adnotarea seturilor de date în volume mari, cu calitatea necesară, suficientă pentru a dezvolta capacități de inteligență artificială, este o sarcină costisitoare și consumatoare de timp, care necesită resurse calificate din diverse domenii.
Cerințele critice ale clientului au fost:
- Acces la lingviști de calitate pentru colecții audio: Colectează 300 de ore de materiale audio pentru limbi precum engleza indiană, hindi și telugu de la lingviști experți din diverse domenii demografice.
- Transcriere și adnotare audio complexă cu o precizie minimă de 90%:
- Am transcris întregul fișier audio, surprinzând toate cuvintele așa cum au fost rostite – inclusiv ezitări, cuvinte de umplutură, începuturi false și alte ticuri verbale
- A furnizat rezultate fără erori, în ciuda unor reguli stricte de transcriere asociate cu pronunțiile dialectale, cuvintele pronunțate greșit, utilizarea non-standard și punctuația.
- Livrarea datelor: Livrarea de fișiere audio de înaltă calitate și diverse, împreună cu transcrierile corespunzătoare (format JSON) pentru 3 limbi, în termen de 12 săptămâni.
Soluția: Colectare audio specifică domeniului, transcriere și adnotare
Cu cunoștințele noastre profunde despre inteligența artificială conversațională, am ajutat clientul să colecteze, să transcrie și să adnoteze datele cu ajutorul unei echipe de lingviști și adnotatori experți, pentru a antrena suita lor vocală multilingvă bazată pe inteligență artificială.
După ce a evaluat numeroși furnizori, clientul a ales Shaip datorită expertizei noastre de a finaliza proiecte de inteligență artificială conversațională în termene stricte, într-un mod eficient din punct de vedere al costurilor și cu calitatea necesară. Echipa lor a fost, de asemenea, impresionată de capacitatea robustă și cuprinzătoare de execuție a proiectelor de către Shaip.
| Limbă | Nr. de ore | Conversație generală spontană (50%) | Conversație spontană în centrul de apeluri (30%) | Conținut media online scos din uz (20%) |
|---|---|---|---|---|
| hindi | 100 | 50 | 30 | 20 |
| Engleză | 100 | 50 | 30 | 20 |
| Telegu | 100 | 50 | 30 | 20 |
| Total | 300 | 150 | 90 | 60 |
- Cerință suplimentară de colectare audio
- Frecvență: Rată de eșantionare – 16 kHz
- Format: WAV
- Durată – Durată generală (5-30 minute) – conversații
- Domeniul vorbirii – BFSI, telecomunicații și comerț cu amănuntul
- Diversitate demografică – Sex: Raport 1:1, Interval de vârstă: 18-60, Capturați ID-ul vorbitorului pentru a identifica fiecare vorbitor în parte
- S-au respectat instrucțiunile pentru segmentarea audio, transcrierea și adnotarea
2.1 Segmentare- Creați segmente de câte 15 secunde fiecare (cu marcaj temporal în milisecunde) pentru fișiere individuale mai mari de 30 de secunde
- Tipuri de sunete segmentate – vorbire, bolboroseală, muzică, zgomot, suprapunere
- Etichetarea segmentelor – ora de început, ora de sfârșit, ID-ul segmentului, nivelul sonorității, tipul de sunet principal,
codul limbii, ID-ul vorbitorului
2.2 Transcriere și adnotare- Am transcris întregul fișier audio, surprinzând toate cuvintele așa cum au fost rostite – inclusiv ezitări, cuvinte de umplutură, începuturi false și alte ticuri verbale, cum ar fi simboluri, caractere
- A furnizat rezultate fără erori, în ciuda unor reguli stricte de transcriere asociate cu pronunții dialectale, cuvinte pronunțate greșit, utilizare non-standard, punctuație, majuscule, abrevieri, contracții, numere, acronime, vorbire difluentă și ininteligibilă, limbaj nețintă nespecificat.
limbi și multe altele.
- Livrarea datelor
Toate fișierele audio și transcrieri WAV au fost livrate în format JSON, în conformitate cu datele demografice unice ale vorbitorilor incluse în termen de 12 săptămâni.
Rezultatul: O suită vocală multilingvă pregătită pentru producție
Datele audio adnotate de înaltă calitate, furnizate de lingviști experți, au permis clientului să își antreneze cu precizie suita vocală multilingvă de procesare a vorbirii bazată pe inteligență artificială în 3 limbi, și anume engleză indiană, hindi și telugu, în timpul stipulat.
Cu seturi de date de antrenament de excepție, clientul a putut oferi servicii inteligente și robuste de vorbire în text, traducere de limbi străine și tastaturi multilingve pentru a rezolva probleme din lumea reală.
Am fost impresionați de capacitatea robustă de execuție a proiectelor oferită de Shaip, de expertiza lor în obținerea, transcrierea și adnotarea datelor audio necesare de la lingviști experți. Verificări multiple ale calității, respectarea termenelor stricte și leadershipul în raportul calitate-preț pe care îl oferă sunt de neegalat.