Anthropic 6. října rozšířil Cyber Verification Program o tři úrovně přístupu. Zahrnují obrannou práci a autorizované testování. Jde o schvalovaný režim existujících modelů, nikoli volný přístup bez ochranných pravidel. Výsledky vlastní evaluace výrobce nejsou nezávislým důkazem bezpečnosti.
Nejzajímavější možnost si lze představit na obyčejném servisním úkolu: bezpečnostní tým porovnává hlášení chyby, vlastní konfiguraci a návrh opravy. AI by mohla hledat souvislosti a připravovat reprodukovatelné testy, zatímco člověk rozhoduje o zásahu. Hodnota by nespočívala v působivém textu, ale v rychleji ověřené opravě bez nového výpadku.
Schválení u dodavatele ovšem nenahrazuje svolení vlastníka testovaného systému. Rozumný pilot potřebuje vymezený rozsah, izolované prostředí, minimální oprávnění a možnost návratu. Změřit se má i počet falešných poplachů a chybně navržených oprav. Agent nesmí dostat oprávnění k produkčnímu zásahu jen proto, že sebejistě vysvětlil svůj postup.
Důležitá je také důvěrnost podkladů. Podmínky programu standardně vyžadují uchovávání dat kvůli kontrole zneužití; specifické výjimky nelze vztahovat na všechny. Enterprise Frontier Safeguards je zatím plán, nikoli dnešní obecné řešení. Firma proto musí před vložením incidentních dat posoudit, zda zvolený režim odpovídá jejím závazkům.
Náš optimistický redakční horizont je 2–6 týdnů pro omezený pilot po schválení přístupu, pokud tým už má testovací prostředí a hodnoticí úlohy. Není to slib termínu registrace. Širší nasazení musí počkat na výsledky vlastních kontrol a prověření ochrany dat; univerzální bezpečnostní autopilot tím oznámením nevznikl.
Diskusi můžete otevřít prvním komentářem.