DeepSeek își consolidează poziția pe piața din China
DeepSeek, un start-up promițător, își propune să își întărească avantajul pe piața internă din China. Luna trecută, compania a demarat o vânzare impresionantă de acțiuni pe piețele globale, evaluată la peste 1.000 de miliarde de dolari, folosind un model de inteligență artificială cu costuri reduse, care a înregistrat performanțe superioare față de mulți dintre competitorii săi occidentali.
Cu sediul în Hangzhou, DeepSeek își accelerează acum dezvoltarea noului model R2, succesor al modelului R1, a cărui lansare era planificată pentru luna mai. Potrivit unor surse din interiorul companiei, lansarea R2 se va realiza cât mai curând posibil, fără a oferi detalii suplimentare. Compania are încredere că acest nou model va oferi o codificare îmbunătățită și va putea raționa în diverse limbi, nu doar în engleză.
Impactul R2 asupra industriei inteligenței artificiale
Rivalitățile din industrie analizează deja implicațiile modelului R1, care, deși utilizează cipuri Nvidia mai puțin puternice, se dovedește competitiv în fața tehnologiilor dezvoltate de giganții americani, cu investiții de sute de miliarde de dolari. „Lansarea modelului R2 de la DeepSeek ar putea reprezenta un moment definitoriu pentru sectorul inteligenței artificiale”, a declarat un expert din domeniu. Succesul DeepSeek în crearea de modele AI accesibile ar putea stimula companiile din întreaga lume să își intensifice eforturile pentru a contracara dominația marilor jucători din domeniu.
De asemenea, lansarea R2 ar putea stârni îngrijorări în rândul autorităților din SUA, care consideră menținerea unei poziții de lider în domeniul inteligenței artificiale ca fiind o prioritate națională. Totodată, această mișcare ar putea mobiliza și mai mult companiile și autoritățile chineze, care deja au început să integreze modelele DeepSeek în produsele lor.
Povestea lui Liang Wenfeng și a DeepSeek
Despre DeepSeek se cunosc puține lucruri, iar fondatorul său, Liang Wenfeng, a devenit cunoscut ca miliardar prin intermediul fondului său de hedging cantitativ, High-Flyer. Deși a fost descris ca fiind o persoană discretă și introvertită, Liang nu a mai comunicat cu presa din luna iulie a anului 2024.
Mai multe interviuri cu foști angajați și profesioniști din domeniu au conturat imaginea unei companii care funcționează ca un laborator de cercetare, evitând constrângerile tradiționale ale industriei tehnologice chineze. Aceasta a fost responsabilă pentru ceea ce mulți investitori consideră a fi una dintre cele mai recente inovații în domeniul inteligenței artificiale.
Un parcurs profesional distinct
Liang s-a născut în 1985 într-un sat din provincia Guangdong și a obținut diplome în ingineria comunicațiilor la Universitatea Zhejiang. Unul dintre primele sale locuri de muncă a fost conducerea unui departament de cercetare la o companie de imagistică inteligentă din Shanghai. Fostul său șef a declarat că Liang a angajat ingineri algoritmiști de top și a adoptat un stil de management mai puțin rigid.
La DeepSeek și High-Flyer, Liang a continuat să evite practicile comune ale marilor companii tehnologice chineze, care se remarcă printr-un management strict și salarii inegale.
Expansiunea DeepSeek și Impactul asupra Tinerilor Angajați
Biroul lui Liang din Beijing, situat aproape de celebrele Universități Tsinghua și Peking, a devenit un punct de atracție pentru tinerii profesioniști din domeniu. Conform mărturiilor a doi foști angajați, Liang se implica activ în discuții tehnice detaliate și era deschis colaborării cu stagiarii din Generația Z, precum și cu proaspeții absolvenți, care reprezentau majoritatea echipei sale. Aceștia au menționat că lucrau, de obicei, opt ore pe zi, într-un mediu colaborativ.
Benjamin Liu, un cercetător de 26 de ani care a părăsit compania în septembrie, a declarat: „Liang ne oferea controlul și ne trata ca pe experți. Ne punea constant întrebări și învăța alături de noi. DeepSeek mi-a permis să îmi asum responsabilități esențiale, ceea ce a fost extrem de interesant.” Liang, însă, nu a răspuns solicitărilor adresate companiei prin intermediul DeepSeek.
Strategia lui Liang în Dezvoltarea Inteligenței Artificiale
În timp ce Baidu și alți giganți tehnologici din China se grăbeau să dezvolte versiuni ale ChatGPT pentru consumatori în 2023, Liang a afirmat anul trecut că a evitat deliberate cheltuielile mari pentru dezvoltarea aplicațiilor, concentrându-se în schimb pe îmbunătățirea calității modelului de inteligență artificială.
Atât DeepSeek, cât și High-Flyer sunt recunoscute pentru remunerațiile generoase oferite angajaților, conform unor surse din domeniu. La High-Flyer, un cercetător de date experimentat poate câștiga anual 1,5 milioane de yuani, în timp ce competitorii rareori depășesc 800.000 de yuani, conform unui manager de fonduri rival care îl cunoaște pe Liang. Această prosperitate financiară a fost susținută de High-Flyer, care a devenit unul dintre cele mai de succes fonduri cantitative din China, gestionând zeci de miliarde de yuani chiar și după reglementările guvernului asupra sectorului.
Investiții în Cercetare și Putere de Calcul
Succesul DeepSeek se bazează pe investițiile semnificative realizate de High-Flyer în cercetare și putere de calcul, în decursul a zece ani. Fondul cantitativ a fost printre primii pionieri în tranzacționarea cu inteligență artificială, reinvestind 70% din veniturile sale în acest domeniu. În perioada 2020-2021, High-Flyer a alocat 1,2 miliarde de yuani pentru două clustere de supercalculatoare AI. Al doilea cluster, denumit Fire-Flyer II, era compus din aproximativ 10.000 de cipuri Nvidia A100, utilizate pentru instruirea modelelor de inteligență artificială.
În momentul în care DeepSeek nu fusese înființat, acumularea de putere de calcul a stârnit interesul autorităților chineze de reglementare a valorilor mobiliare. O persoană familiarizată cu gândirea oficialilor a menționat: „Autoritățile de reglementare au dorit să afle motivul pentru care aveau nevoie de atât de multe cipuri.”
DeepSeek și Impactul său asupra Pieței Inteligenței Artificiale
Autoritățile au ales să nu intervină într-o decizie care s-a dovedit esențială pentru evoluția DeepSeek. În 2022, Statele Unite au interzis exportul de cipuri A100 în China, moment în care Fire-Flyer II era deja în operare. Beijingul a început să celebreze realizările DeepSeek, dar a instruit compania să evite contactul cu mass-media fără o aprobată prealabilă, conform unei surse familiare cu gândirea oficială chineză. Aceasta a subliniat că autoritățile îi cer lui Liang să mențină un profil discret, temându-se că o expunere prea mare în mass-media ar putea atrage atenția nedorită.
Ministerul Comerțului din China și autoritatea de reglementare a valorilor mobiliare nu au oferit comentarii la solicitările de informații. DeepSeek, alături de High-Flyer, se numără printre puținele companii care dispun de un cluster mare de cipuri A100, reușind astfel să atragă talente de vârf în domeniul cercetării din China, conform a doi foști angajați. Liu, unul dintre aceștia, a menționat că avantajul principal al resurselor extensive de calcul este capacitatea de a experimenta la scară mare.
Antreprenorii occidentali din domeniul inteligenței artificiale, precum Alexandr Wang, CEO al Scale AI, au estimat că DeepSeek ar deține până la 50.000 de cipuri Nvidia de ultimă generație, al căror export este interzis în China. Totuși, Wang nu a prezentat dovezi pentru această afirmație și nu a răspuns solicitărilor de a oferi informații suplimentare. DeepSeek nu a comentat aceste declarații.
Doi foști angajați au subliniat că succesul companiei se datorează concentrației lui Liang pe o arhitectură AI mai eficientă din punct de vedere al costurilor. Start-up-ul a implementat tehnici precum Mixture-of-Experts (MoE) și multihead latent attention (MLA), care permit reducerea semnificativă a costurilor de calcul, conform documentelor sale de cercetare. Tehnica MoE împarte un model AI în diverse domenii de expertiză, activând doar acelea relevante pentru o anumită interogare, spre deosebire de arhitecturile tradiționale care utilizează întregul model.
Arhitectura MLA permite procesarea simultană a diferitelor aspecte ale informației, facilitând detectarea eficientă a detaliilor esențiale. Deși concurenți precum Mistral din Franța au dezvoltat modele bazate pe MoE, DeepSeek a fost prima companie care s-a bazat în mod semnificativ pe această arhitectură, reușind totodată să atingă paritatea cu modele mai costisitoare. Conform estimărilor analiștilor de la Bernstein, prețurile DeepSeek au fost cu 20 până la 40 de ori mai mici decât cele cerute de OpenAI pentru modele echivalente, la începutul lunii februarie.
În prezent, giganții tehnologici din Occident și China continuă să investească masiv în inteligența artificială. Totuși, succesul DeepSeek cu modelul R1 și cu modelul său anterior V3 a determinat unii jucători din industrie să-și ajusteze strategiile. OpenAI a redus recent prețurile, iar Google a implementat reduceri pentru Gemini. De la lansarea modelului R1, OpenAI a introdus și modelul O3-Mini, care se bazează pe o putere de calcul mai mică. Adnan Masood, de la furnizorul american de servicii tehnologice UST, a anunțat că laboratorul său a realizat analize comparative care au evidențiat avantajele modelului R1.
Adopția DeepSeek de către China
Înainte ca R1 să devină o atracție globală, semnele indicau deja că DeepSeek câștigase favorurile Beijingului. În luna ianuarie, mass-media de stat a relatat despre o întâlnire în care Liang, fondatorul DeepSeek, a reprezentat sectorul inteligenței artificiale la o discuție cu premierul chinez Li Qiang, fiind considerat un reprezentant important, înaintea altor lideri din industrie mai bine cunoscuți.
Declarațiile ulterioare referitoare la competitivitatea costurilor modelelor DeepSeek au întărit convingerea autorităților de la Beijing că China poate inova mai rapid decât Statele Unite. Astfel, atât companiile, cât și instituțiile guvernamentale din China au început să adopte modelele DeepSeek într-un ritm semnificativ, nefiind oferit același sprijin altor companii.
Cel puțin 13 primării din China și 10 companii energetice de stat au anunțat integrarea DeepSeek în sistemele lor. De asemenea, marii jucători din tehnologie, precum Lenovo, Baidu și Tencent – care deține cea mai populară aplicație de social media din China, WeChat – au inclus modelele DeepSeek în produsele lor.
Sprijinul oficial chinez
Conform expertului în politici publice Alfred Wu, liderii chinezi, inclusiv Xi Jinping și Li Qiang, „au semnalat că susțin DeepSeek”. Wu a adăugat: „Acum, toată lumea îl susține”, referindu-se la sprijinul larg pe care îl primește compania în contextul actual.
Acest entuziasm din partea Chinei apare pe fondul unor acțiuni din partea guvernelor din diverse țări, precum Coreea de Sud și Italia, care au decis să elimine DeepSeek din magazinele lor de aplicații din cauza preocupărilor legate de confidențialitate.
Provocările viitoare
Dacă DeepSeek devine modelul preferat de inteligență artificială pentru entitățile de stat din China, autoritățile de reglementare din Occident ar putea intensifica restricțiile asupra cipurilor avansate de inteligență artificială și colaborărilor software, conform analistului Stephen Wu, fondator al Carthage Capital.
Liang a recunoscut provocările legate de posibilele restricții, subliniind că „problema noastră nu a fost niciodată finanțarea, ci embargoul asupra cipurilor din gama de vârf”. Aceasta sugerează că, în timp ce DeepSeek câștigă teren în China, provocările externe și reglementările internaționale ar putea influența dezvoltarea sa pe termen lung.