Lucrători în mulțime pentru colectarea datelor

Lucrători în mulțime pentru colectarea datelor – o parte indispensabilă a IA etică

În eforturile noastre de a construi soluții de inteligență artificială robuste și imparțiale, este pertinent să ne concentrăm pe antrenarea modelelor pe baza unui sortiment imparțial, dinamic și reprezentativ de date. Procesul nostru de colectare a datelor este extrem de important în dezvoltarea unor soluții de inteligență artificială credibile. În acest sens, colectarea datelor de antrenament în domeniul inteligenței artificiale prin intermediul lucrătorilor colaborativi devine un aspect critic al strategiei de colectare a datelor.

În acest articol, haideți să explorăm rolul lucrătorilor în grup (crowd workers), impactul lor asupra dezvoltării algoritmilor de învățare bazați pe inteligență artificială și a modelelor de învățare automată (ML), precum și necesitatea și beneficiile pe care le oferă întregului proces.

De ce sunt obligați lucrătorii în mulțime să construiască modele AI?

Ca oameni, generăm tone de date, însă doar o fracțiune din aceste date generate și colectate au valoare. Din cauza lipsei unor standarde de evaluare comparativă a datelor, majoritatea datelor colectate sunt fie părtinitoare, fie pline de probleme de calitate, fie nu sunt reprezentative pentru mediu. Întrucât se dezvoltă din ce în ce mai multe modele de învățare automată și de învățare profundă care prosperă pe baza unor cantități masive de date, nevoia de seturi de date mai bune, mai noi și mai diverse este din ce în ce mai resimțită.

Este locul în care lucrătorii mulțimii intră în joc.

Datele crowd-sourcing construiesc un set de date cu participarea unor grupuri mari de oameni. Lucrătorii mulțimii infuzează inteligența umană în inteligența artificială.

Platformele de crowdsourcing oferă microtasking-uri de colectare a datelor și adnotare unui grup mare și diversificat de persoane. Crowdsourcing-ul permite companiilor să acceseze o forță de muncă masivă, dinamică, rentabilă și scalabilă.

Cea mai populară platformă de crowdsourcing – Amazon Mechanical Turk, a reușit să genereze 11 mii de dialoguri interumane în 15 ore, plătind lucrătorilor 0.35 dolari pentru fiecare dialog reușit. Lucrătorii din crowdsourcing sunt angajați pentru o sumă atât de mică, ceea ce scoate în evidență importanța construirii unor standarde etice de aprovizionare a datelor.

Teoretic, pare un plan inteligent, dar nu este o strategie ușor de executat. Anonimatul lucrătorilor din mulțime a dat naștere la probleme cu salariile scăzute, nerespectarea drepturilor lucrătorilor și munca de proastă calitate care afectează performanța modelului AI. 

Beneficiile de a avea lucrători în mulțime pentru a sursa date

Angajând un grup divers de lucrători în mulțime, dezvoltatorii de soluții bazate pe inteligență artificială pot distribui micro sarcini și aduna observații variate și răspândite rapid și la un cost relativ scăzut.

Unele dintre beneficiile proeminente ale angajării lucrătorilor în mulțime pentru proiecte AI sunt

Culegerea de date beneficiază prin lucrătorii în mulțime

Timp de lansare pe piață mai rapid: Conform unui studiu realizat de Cognilytica, aproape 80% din timpul alocat proiectelor de inteligență artificială este dedicat activităților de colectare a datelor, cum ar fi curățarea, etichetarea și agregarea datelor. Doar 20% din timp este dedicat dezvoltării și instruirii. Barierele tradiționale în calea generării de date sunt eliminate, deoarece un număr mare de contribuitori pot fi recrutați într-un timp scurt.

Soluție eficientă din punct de vedere al costurilor: Colectarea datelor prin intermediul crowdsourcing-ului reduce timpul și energia cheltuite pentru instruire, recrutare și implicare. Acest lucru elimină costurile, timpul și resursele necesare, deoarece forța de muncă este angajată pe baza unei metode de plată per sarcină.

Crește diversitatea în setul de date: Diversitatea datelor este esențială pentru întregul antrenament al soluțiilor de inteligență artificială. Pentru ca un model să producă rezultate imparțiale, acesta trebuie să fie antrenat pe un set de date divers. Prin intermediul crowdsourcing-ului de date, este posibil să se genereze seturi de date diverse (geografice, limbi, dialecte) cu efort și costuri minime.

Îmbunătățește scalabilitatea: Atunci când recrutați lucrători de încredere în cadrul crowdwork-ului, puteți asigura colectarea de date de înaltă calitate , care poate fi scalată în funcție de nevoile proiectului dumneavoastră.

Intern vs. crowdsourcing – Cine iese câștigător?

Date interneDate crowdsource
Pot fi garantate acuratețea și consistența datelor.Calitatea datelor, acuratețea și coerența pot fi menținute dacă sunt angajate platforme de crowdsourcing fiabile cu măsuri standard de asigurare a calității
Aprovizionarea internă a datelor nu este întotdeauna o decizie practică, deoarece echipa dvs. internă ar putea să nu satisfacă cerințele proiectului.Diversitatea datelor poate fi asigurată, deoarece este posibil să recrutați un grup eterogen de lucrători în mulțime în funcție de nevoile proiectului.
Recrutarea și instruirea lucrătorilor pentru nevoile proiectului este costisitoare.Soluție rentabilă pentru de colectare a datelor deoarece este posibil să recrutați, să instruiți și să îmbarcați lucrători cu mai puține investiții.
Timpul de introducere pe piață este mare, deoarece colectarea internă a datelor durează considerabil.Timpul de piață este semnificativ mai mic, deoarece multe contribuții vin rapid.
Un grup mic de colaboratori și etichetatori interniUn grup mare și divers de colaboratori și etichetatoare de date
Confidențialitatea datelor este foarte ridicată cu o echipă internă.Confidențialitatea datelor este dificil de păstrat atunci când lucrezi cu muncitori aglomerați din întreaga lume.
Mai ușor de urmărit, instruit și evaluat colectorii de dateEste dificil să urmăriți și să instruiți colectorii de date.

Reducerea decalajului dintre lucrătorii crowdsource și solicitant.

Reducerea decalajului dintre lucrătorii crowdsource și solicitant Există o nevoie urgentă de a reduce decalajul dintre muncitorii de mulțime și solicitanți, nu doar în domeniul salariilor.

Există o lipsă flagrantă de informații din partea solicitantului, deoarece lucrătorilor li se oferă doar informații cu privire la sarcina specifică. De exemplu, deși lucrătorilor li se dau micro-sarcini, cum ar fi înregistrarea dialogurilor în dialectul lor matern, rareori li se oferă context. Aceștia nu au informațiile necesare cu privire la motivul pentru care fac ceea ce fac și cum să o facă cel mai bine. Această lipsă de informații are impact asupra calității muncii finanțate prin crowdsourcing.

Pentru o ființă umană, a avea întregul context oferă claritate și scop muncii lor.

Adăugați la acest amestec o altă dimensiune a NDA – acordurile de nedivulgare care limitează cantitatea de informații oferite unui lucrător de mulțime. Din perspectiva lucrătorilor în mulțime, această retragere a informațiilor arată o lipsă de încredere și o importanță redusă pentru munca lor.

Când aceeași situație este privită din perspectiva opusă, există o lipsă de transparență din partea lucrătorului. Solicitantul nu înțelege pe deplin cine este lucrătorul însărcinat să efectueze lucrarea. Unele proiecte ar putea necesita un anumit tip de lucrător; cu toate acestea, în majoritatea proiectelor, există ambiguitate. Adevărul este că acest lucru poate complica evaluarea, feedback-ul și instruirea pe viitor.

Pentru a contracara aceste dificultăți, este importantă colaborarea cu experți în colectarea datelor cu experiență în furnizarea de date diverse, organizate și bine reprezentate de la o selecție largă de colaboratori.

Alegerea Shaip ca partener de date poate avea multiple beneficii. Ne concentrăm pe diversitate și pe distribuțiile reprezentative ale datelor. Personalul nostru experimentat și dedicat înțelege compulsiunile fiecărui proiect și dezvoltă seturi de date care pot antrena soluții robuste bazate pe inteligență artificială în cel mai scurt timp.

[Citește și: Ghid introductiv pentru datele de antrenament în domeniul inteligenței artificiale: definiție, exemplu, seturi de date ]

Ți-a plăcut acest articol? Urmărește-l pe Shaip pe LinkedIn pentru mai multe actualizări.

Partajare socială