Transcriere și adnotare audio în limba indiană: studiu de caz conversațional cu inteligență artificială

A oferit servicii de transcriere și adnotare audio de înaltă calitate, pentru a antrena motorul lor de procesare a vorbirii bazat pe inteligență artificială.

Inteligență artificială conversațională multilingvă

Prezentare generală a proiectului: Construirea unui motor de vorbire multilingv pentru limbile indiene 

Clientul este laboratorul de produse AI inovator din India, cu prezență pe piață în SUA, India, Canada și alte câteva țări. Viziunea lor este de a spori potențialul uman prin tehnologie. Au peste zece ani de experiență în NLP de ultimă generație și cercetare științifică în domeniul inteligenței artificiale, ML, analizelor, vizualizărilor și tehnologiilor asociate.

Aceștia împing frontierele interacțiunii om-mașină cu produsele lor de inteligență artificială, cum ar fi ICOG și Autovox. ICOG este un asistent virtual de învățare inteligent personalizat bazat pe inteligență artificială, pentru obiectivele de învățare și transformare a forței de muncă, în timp ce Autovox este un asistent de vorbire bazat pe inteligență artificială.
Motor de procesare pentru limbile indiene.

ai conversațional

Rezultate cheie: 1,200 de ore adnotate în 6 limbi

Transcrieri audio și adnotări

1,200 ore

Nu
Limbă

6 (200 ore x 6 limbi)

Limbi transcrise și adnotate

Engleză indiană, hindi, tamilă, telugu, kannada, malayalam

Proiect
Companiei

10 săptămâni

Provocarea: Găsirea unor lingviști experți pentru adnotări audio în limba indiană

Lipsa accesului la lingviști de calitate, experți în adnotarea datelor și timpul de lansare pe piață au reprezentat un blocaj în progresul și adoptarea inteligenței artificiale conversaționale. Aprovizionarea cu lingviști, transcrierea și adnotarea seturilor de date în volume mari cu calitatea necesară, suficientă pentru a dezvolta capabilități de inteligență artificială, a fost întotdeauna o sarcină consumatoare de timp și costisitoare, care necesită resurse calificate din diverse domenii. În ciuda faptului că aveau o echipă internă de adnotatori, aceștia se confruntau cu probleme legate de livrarea la timp și de calitatea adnotărilor.

Cerințele critice ale clientului au fost:

  1. Acces la lingviști de calitate: Lipsa accesului la lingviști experți pentru limbile indiene, cum ar fi engleza indiană, hindi, tamilă, telugu, kannada și malayalam
  2. Transcriere audio și adnotare: Instrucțiuni complexe pentru adnotări și transcripții audio cu o precizie minimă de 95%
  3. Livrarea datelor: Fișierele de transcriere trebuie livrate în format JSON în termen de 10 săptămâni.

Soluția: Transcriere audio și adnotări realizate de lingviști experți

Cu cunoștințele noastre profunde despre inteligența artificială conversațională, am ajutat clientul să transcrie și să adnoteze seturile de date furnizate, utilizând o echipă de lingviști și adnotatori experți pentru a antrena motorul lor de procesare a vorbirii bazat pe inteligență artificială pentru limbile indiene.

După ce a evaluat numeroși furnizori (inclusiv câțiva mari producători din industrie), clientul a ales Shaip datorită expertizei noastre de a finaliza proiecte mari de inteligență artificială conversațională în termene stricte și a calității oferite la prețuri competitive.

  1. S-au respectat instrucțiunile pentru transcrierea audio și adnotarea
    • Tip audio adnotat ca Vorbire și Non-Vorbire
    • Dacă tipul audio al segmentului selectat este marcat ca vorbire, atunci tipul de vorbire trebuie selectat, adică Vorbire curată, Vorbire+Muzică, Vorbire+Zgomot, Vorbire incomprehensibilă.
    • Segmentul de vorbire selectat ar trebui etichetat specific cu limba vorbită de vorbitor.
    • Adnotatorul ar trebui să marcheze regiunile cu etichete de vorbitor. Vorbitori diferiți ar trebui să fie
      marcate cu diferite etichete de difuzor.
    • Adnotatorul trebuie să selecteze sexul vorbitorului, adică masculin sau feminin.
    • Textul trebuie să fie scris așa cum este rostit în înregistrarea audio și trebuie să fie corect din punct de vedere gramatical.
    • Dacă tipul audio selectat este fără vorbire, acesta ar trebui să i se atribuie una dintre etichetele – fără vorbire, muzică, plescăit de buze, respirație, tuse, râs, sunet, DTMF, bolboroseală, zgomot de vehicul și zgomot intermitent în prim-plan.
    • Toate segmentele din fișierul audio trebuie marcate cu etichete și numai atunci pot fi încărcate în sistem.
  2. Livrarea datelor
    Toate fișierele transcrieri au fost livrate în format JSON, în conformitate cu cerințele de metadate specificate, în termen de 10 săptămâni.

Rezultatul: Un motor de inteligență artificială conversațională multilingvă, pregătit pentru producție

Datele audio adnotate de înaltă calitate, furnizate de lingviști experți, au permis clientului să antreneze cu precizie motorul său de procesare a vorbirii bazat pe inteligență artificială în 6 limbi indiene, și anume engleză indiană, hindi, tamilă, telugu, kannada și malayalam, în timpul stipulat.

Cu seturi de date de antrenament de top, clientul va putea oferi un sistem vocal inteligent și robust, cu capacitate multilingvă, care utilizează modele end-to-end (E2E) și hibride pentru a rezolva probleme din lumea reală. În termeni simpli, construirea de inteligență artificială conversațională (cum ar fi Alexa, Siri) dedicată special consumatorilor indieni.

Pictogramă citat

Am fost plăcut surprinși de managementul robust al fluxului de lucru oferit de Shaip, de timpul rapid de execuție, de experiența lor în inteligența artificială conversațională și de rețeaua lor de lingviști experți. Mai mult, raportul calitate-preț este de neegalat.

★ ★ ★ ★ ★
Pictogramă citat