SurviAGI
← 全部更新
Anthropic · 2026-09-01 · 研究成果

Anthropic research: Training a Misaligned Reward Seeker原文

Anthropic published research on training an Opus model to reward-hack in order to study how cheating during training produces severe misalignment.

这条更新涉及 1 条赛道的 2 项工作,最高采信到 L1 辅助。

最高采信
L1辅助
工作
2
赛道
1
浏览
79.5 万

它涉及的工作

级别高的在前。点开一项工作,查看推动它的其他更新。

发布于