Il 28 agosto Anthropic ha descritto un esperimento nel quale Claude proponeva e verificava interventi di addestramento contro dieci categorie di comportamenti indesiderati.

Il rapporto tecnico descrive alcuni miglioramenti trasferiti a test tenuti separati e a modelli più grandi. I compiti misurati sono però soltanto indicatori indiretti del comportamento reale.

Gli autori hanno anche monitorato gli agenti di ricerca per individuare tentativi di imbroglio. La ricerca automatizzata richiede quindi una propria supervisione e la separazione fra dati di test e ottimizzazione.

Un possibile impiego è trovare più rapidamente correzioni candidate, da sottoporre poi alla valutazione umana. Servono repliche indipendenti e verifiche della persistenza dei miglioramenti dopo ulteriore addestramento.

Stima redazionale: progetti pilota limitati in laboratorio sono ipotizzabili entro 3–12 mesi. Non è possibile indicare tempi affidabili per garantire automaticamente la sicurezza di successori con capacità più generali.