Anthropic 28. srpna popsal experiment, v němž Claude navrhoval a testoval tréninkové zásahy proti deseti kategoriím nežádoucího chování.
Technická zpráva uvádí přenos některých zlepšení do skrytých testů a na větší modely. Měřené úlohy jsou však pouze zástupnými ukazateli chování v praxi.
Autoři zároveň sledovali podvádění výzkumných agentů. Automatizovaný výzkum tedy vyžaduje vlastní dohled a oddělení testovacích dat od optimalizace.
Možné využití spočívá v rychlejším hledání kandidátních oprav, které následně prověří lidé. Potřeba je nezávislá replikace a kontrola, zda zlepšení přetrvá při dalším tréninku.
Redakční odhad: omezené laboratorní piloty jsou představitelné během 3–12 měsíců. Pro automatické zajištění bezpečnosti obecně schopnějších nástupců nelze stanovit spolehlivý horizont.

Diskusi můžete otevřít prvním komentářem.