Dificultatea de a Distinge Între Voci Reale și Voci „Deepfake”
Cine crede că poate diferenția ușor o voce umană autentică de una generată de inteligența artificială se înșală. Un studiu recent publicat în revista PLoS One a arătat că majoritatea oamenilor nu reușesc să facă această distincție. Atunci când ascultă voci umane alături de versiuni generate de AI ale acelorași voci, participanții nu pot identifica cu precizie care sunt reale și care sunt artificiale, conform celor de la Live Science.
Experiența Cotidiană cu Voci Generată de AI
Mulți dintre noi am interacționat cu vocile inteligenței artificiale prin asistenți personali precum Siri sau Alexa. Aceste voci, cu intonațiile lor monotone și pronunția mecanică, ne fac să credem că putem distinge fără efort între o voce umană și una generată de AI. Totuși, cercetătorii susțin că ascultătorii obișnuiți nu mai sunt capabili să facă această distincție. Nadine Lavan, conferențiar în psihologie la Universitatea Queen Mary din Londra și autoarea principală a studiului, a subliniat că „vocile generate de AI sunt acum omniprezente. Toți am interacționat cu Alexa sau Siri sau am primit apeluri de la sisteme automate de servicii pentru clienți. Aceste voci nu sună chiar ca cele umane reale, dar era doar o chestiune de timp până când tehnologia AI a început să producă un discurs natural, care seamănă cu cel uman”.
Clonarea Vocii și Implicațiile Sale
Studiul a demonstrat că vocile generice, create de la zero, nu erau considerate realiste, în timp ce clonele vocale antrenate pe vocile unor persoane reale, adică audio deepfake, au fost considerate la fel de credibile ca omologii lor umani. Participanții au avut la dispoziție 80 de mostre de voci (40 generate de AI și 40 umane) și au fost rugați să identifice care dintre acestea erau reale și care erau artificiale. În medie, doar 41% dintre vocile AI create de la zero au fost clasificate eronat ca fiind umane, ceea ce sugerează că, în multe cazuri, este încă posibil să le deosebești de persoanele reale.
Cu toate acestea, în cazul vocilor generate de AI, clonate de la oameni, 58% au fost clasificate greșit ca fiind umane. Doar 62% dintre vocile umane au fost corect identificate ca atare, ceea ce a condus cercetătorii să concluzioneze că nu există o diferență statistică semnificativă în capacitatea noastră de a distinge vocile reale de clonele lor deepfake.
Riscurile Asociate cu Tehnologia Deepfake
Aceste rezultate aduc în discuție implicații etice, de drepturi de autor și de securitate, conform spuselor lui Lavan. Dacă infractorii ar utiliza AI pentru a clona vocea cuiva, ar deveni mult mai simplu să ocolească protocoalele de autentificare vocală, cum ar fi cele utilizate de bănci, sau să păcălească persoane dragi să transfere bani.
Deja au existat incidente în acest sens. De exemplu, pe 9 iulie, Sharon Brightwell a fost victima unei înșelătorii în valoare de 15.000 de dolari. Aceasta a ascultat ceea ce credea că este vocea fiicei sale plângând la telefon, afirmând că a avut un accident și că are nevoie de bani pentru reprezentare legală pentru a nu ajunge la închisoare.
Riscurile și oportunitățile tehnologiei vocale bazate pe inteligența artificială
Recent, Brightwell a subliniat provocările etice legate de tehnologia AI avansată, afirmând că aceasta ar putea induce în eroare publicul, având potențialul de a crea voci extrem de realiste. Aceste voci AI pot fi utilizate pentru a genera declarații sau interviuri false cu politicieni sau celebrități, ceea ce ridică semne de întrebare asupra veridicității informațiilor difuzate.
Pericolele fraudelor
Înregistrările audio false pot avea un impact devastator, fiind folosite pentru a discredita persoane sau pentru a provoca tulburări sociale, generând diviziuni și conflicte. De exemplu, recent, escrocii au utilizat o clonă AI a vocii premierului din Queensland, Steven Miles, pentru a încerca să convingă oamenii să investească într-o schemă fraudulentă legată de Bitcoin.
Accesibilitatea tehnologiei
Cercetătorii au demonstrat că clonele vocale utilizate în studiu nu sunt neapărat sofisticate. Acestea au fost create cu ajutorul unui software comercial și antrenate cu doar patru minute de înregistrări vocale umane. Navan a declarat că „procesul a necesitat cunoștințe minime, doar câteva minute de înregistrări vocale și costuri aproape inexistente”, evidențiind astfel accesibilitatea și sofisticarea tehnologiei vocale bazate pe inteligența artificială.
Posibilități pozitive ale tehnologiei AI
Deși deepfake-urile pot fi exploatate de actori răuvoitori, există și perspective pozitive asociate cu această tehnologie. Navan a menționat că „ar putea exista aplicații pentru îmbunătățirea accesibilității, educației și comunicării, unde vocile sintetice personalizate de înaltă calitate pot îmbunătăți experiența utilizatorului”.
Astfel, deși provocările sunt semnificative, tehnologia vocală bazată pe inteligența artificială poate aduce și beneficii considerabile societății.