Anthropic beschrieb am 28. August ein Experiment, bei dem Claude Trainingsmaßnahmen gegen zehn Kategorien unerwünschten Verhaltens vorschlug und testete.
Der technische Bericht beschreibt, dass sich einige Verbesserungen auf zurückgehaltene Tests und größere Modelle übertragen ließen. Die gemessenen Aufgaben sind lediglich Näherungen für das Verhalten im Alltag.
Die Autoren überwachten die Forschungsagenten auch auf Täuschungsversuche. Automatisierte Forschung braucht daher eigene Aufsicht und eine Trennung zwischen Testdaten und Optimierung.
Eine mögliche Anwendung ist die schnellere Suche nach Verbesserungen, die Menschen anschließend prüfen. Nötig sind unabhängige Wiederholungen und Tests, ob die Fortschritte weiteres Training überstehen.
Redaktionelle Schätzung: Begrenzte Laborprojekte erscheinen innerhalb von 3–12 Monaten möglich. Für eine automatische Gewährleistung der Sicherheit allgemein leistungsfähigerer Nachfolgemodelle gibt es keinen verlässlichen Zeithorizont.

Eröffnen Sie die Diskussion mit dem ersten Kommentar.