Anthropic 28. srpna popsal experiment, v němž Claude navrhoval a testoval tréninkové zásahy proti deseti kategoriím nežádoucího chování.

Technická zpráva uvádí přenos některých zlepšení do skrytých testů a na větší modely. Měřené úlohy jsou však pouze zástupnými ukazateli chování v praxi.

Autoři zároveň sledovali podvádění výzkumných agentů. Automatizovaný výzkum tedy vyžaduje vlastní dohled a oddělení testovacích dat od optimalizace.

Možné využití spočívá v rychlejším hledání kandidátních oprav, které následně prověří lidé. Potřeba je nezávislá replikace a kontrola, zda zlepšení přetrvá při dalším tréninku.

Redakční odhad: omezené laboratorní piloty jsou představitelné během 3–12 měsíců. Pro automatické zajištění bezpečnosti obecně schopnějších nástupců nelze stanovit spolehlivý horizont.