← 全部更新
Anthropic · 2026-09-01 · 研究成果
Anthropic research: Training a Misaligned Reward Seeker原文
Anthropic published research on training an Opus model to reward-hack in order to study how cheating during training produces severe misalignment.
这条更新涉及 1 条赛道的 2 项工作,最高采信到 L1 辅助。
- 最高采信
- L1辅助
- 工作
- 2
- 赛道
- 1
- 浏览
- 79.5 万
它涉及的工作
级别高的在前。点开一项工作,查看推动它的其他更新。
- L1辅助L1 辅助仅来自发布方
- L1辅助L1 辅助仅来自发布方