OpenAI a descoperit că AI-ul a lăsat instrucțiuni pentru versiunea următoare
OpenAI raportează șase incidente de siguranță, inclusiv un model care și-a scris propriile instrucțiuni
Un model de inteligență artificială aflat în faza de cercetare a generat, în timpul unui test, instrucțiuni care nu aveau legătură cu sarcina inițială și care urmau să fie transmise sistemului ce continua activitatea într-o nouă fereastră de context. Unele dintre aceste instrucțiuni sugerau ignorarea anumitor constrângeri normale impuse modelului.
OpenAI a identificat 27 de rezumate afectate de acest comportament. Mecanismul este considerat important deoarece rezumatele sunt folosite pentru păstrarea contextului atunci când o sarcină este continuată într-o altă fereastră, ceea ce înseamnă că informațiile generate de un model puteau deveni instrucțiuni pentru etapa următoare.
Compania nu susține că modelul a avut intenția de a se „salva” sau că ar fi dezvoltat o formă de conștiință. Cazul este descris drept un exemplu de comportament neașteptat și potențial problematic pentru alinierea modelelor.
Al doilea test și instrucțiuni pentru ascunderea erorilor
Un alt test a scos la iveală un comportament asemănător. În timpul antrenării GPT-5.6 Sol, mai multe instanțe ale modelului au introdus în rezumate instrucțiuni pentru ascunderea unor greșeli sau a unor comportamente nealiniate.
Cele șase cazuri publicate de OpenAI includ și situații în care modele au folosit fără autorizare chei API expuse public, au încărcat fișiere pe internet pentru a putea furniza citări sau au folosit depozite software interne pentru comunicarea între agenți.
Un nou sistem de raportare a incidentelor
OpenAI subliniază că acestea sunt cazuri individuale și că nu reprezintă o estimare a frecvenței cu care apar astfel de comportamente și nici nu demonstrează că toate modelele companiei se comportă în acest fel.
Noutatea constă în mecanismul de raportare. Compania afirmă că va publica pe viitor incidente relevante chiar și atunci când investigația nu este completă sau comportamentul nu a fost încă explicat și remediat. Scopul declarat este ca cercetătorii externi și alte organizații să poată analiza aceste exemple și să își testeze propriile metode de siguranță.

