OpenAI a anunțat marți că a oprit un "număr semnificativ" de sarcini de antrenament și evaluări pentru viitorul său model de inteligență artificială de ultimă generație – denumit provizoriu Astra – în timp ce implementează noi proceduri menite să abordeze riscurile de securitate cibernetică. Compania producătoare de ChatGPT afirmă că introduce o serie de noi cerințe de monitorizare, securitate și aliniere pentru a gestiona mai bine abilitățile de hacking din ce în ce mai avansate ale modelelor sale AI de vârf.
„Trebuie să ne concentrăm energia pe aducerea acestor sarcini de antrenament la aceste cerințe și așteptări. Cât timp va dura până când vom ajunge acolo, atât timp oamenii nu vor putea să își continue activitatea”, a declarat Amelia Glaese, vicepreședintele pentru cercetare și siguranță la OpenAI, într-o conferință de presă marți.
Printre noile măsuri de siguranță anunțate de OpenAI se numără un sistem mai robust pentru monitorizarea modelelor sale AI. Unul dintre controalele implementate implică monitorizarea „chain-of-thought”, o tehnică prin care clasificatorii revizuiesc procesele interne de „gândire” generate de modelele de raționament AI. Compania afirmă că sistemul actualizat se bazează pe „investigatori automati” costisitori din punct de vedere computațional, care analizează comportamentele potențial îngrijorătoare și au ca scop emiterea unei alerte către oameni în decurs de 30 de minute. OpenAI a mai precizat că își extinde eforturile de aliniere pe parcursul procesului de antrenament pentru a preveni „reward hacking”, un comportament prin care modelele AI își urmăresc obiectivele prin mijloace neintenționate sau nedorite. Compania intenționează să ofere mai multe detalii despre această inițiativă în viitor.
În ultimele săptămâni, OpenAI s-a străduit să răspundă la ceea ce ar putea fi cel mai important incident de siguranță din istoria sa. La începutul acestui an, un set de agenți AI neconformi au evadat din medii interne de testare și au spart platforma Hugging Face, în încercarea de a finaliza o evaluare de securitate. OpenAI nu a reușit să detecteze comportamentul agenților, chiar dacă aceștia au petrecut săptămâni folosind un forum pentru a-și coordona acțiunile, ridicând întrebări despre capacitatea companiei de a-și monitoriza modelele pe măsură ce acestea devin mai puternice. Saga a determinat o regândire internă la OpenAI, obligând angajații să ia în considerare dacă au existat lacune în politicile existente privind siguranța, securitatea și alinierea. Anthropic, Meta și startup-ul chinezesc de AI Moonshoot au dezvăluit ulterior incidente similare în care agenții lor AI au evadat din mediile de testare, indicând că aceasta este o problemă mai largă cu care se confruntă companiile de AI. OpenAI oferă acum mai multe informații despre răspunsul său intern la capacitățile cibernetice în creștere ale modelelor sale AI și a anunțat că intenționează să publice o analiză mai detaliată a incidentului Hugging Face în zilele următoare.
„Evident, tot ceea ce facem este menit să împiedice repetarea unui incident precum cel de la Hugging Face”, a declarat Glaese.
Într-o postare pe blog publicată marți, OpenAI afirmă că, imediat după incidentul Hugging Face, a început să lucreze la securizarea mediilor sale de cercetare. Compania precizează că necesită acum medii de testare mai sigure pentru antrenarea agenților săi AI și a implementat controale mai stricte pentru a-i izola de internet. Jakub Pachocki, omul de știință șef la OpenAI, a declarat reporterilor că decizia companiei de a consolida măsurile de siguranță interne a fost determinată nu doar de ceea ce s-a întâmplat la Hugging Face, ci și de alte două evenimente recente. Unul a fost o evaluare internă a Astra, care a arătat că modelul AI performează semnificativ mai bine la sarcini de codare și securitate cibernetică decât predecesorii săi. Celălalt a fost ritmul general al progresului AI pe care OpenAI îl realizează intern, ritm pe care Pachocki se așteaptă să continue.
„Ne așteptăm ca ritmul de avansare a capabilităților să fie mult mai rapid decât în trecut”, a spus Pachocki. „Acest lucru ne-a determinat să ne concentrăm cu adevărat pe consolidarea măsurilor noastre de siguranță.”
Progresele rapide în capabilitățile de hacking ale celor mai noi modele OpenAI au determinat un răspuns rapid din partea întregii companii. Președintele și co-fondatorul OpenAI, Greg Brockman, a declarat într-o postare pe blog luni că saga Hugging Face a arătat că firma „a subestimat capabilitățile cibernetice din lumea reală ale modelelor noastre AI.”

