Anthropic 工程师揭示 Claude 写作退步原因:模型训练目标转向 AI 而非人类读者

IT之家 9 月 23 日报道,AI 模型在数学、编程和推理能力方面取得了显著进展,然而写作水平却未见提升,甚至出现下滑,Anthropic 旗下的 Claude 模型也不例外。

为何 Opus 4.6 成为 Anthropic 最后一款在写作方面表现优异的模型?负责 Claude 微调的 Anthropic 工程师杰克逊·克尼恩今天(23 日)对此作出说明:后续模型在优化过程中,更侧重于数学与代码能力的提升。

这些模型还接受了大量针对其他 AI 模型撰写技术解释的训练,这正是导致 Claude 逐渐形成独特表达风格——即所谓的“Claude 腔”(Claudeish)——的核心原因。克尼恩表示,模型被“调整以适应 LLM 的思维方式”,最终学会了为 AI 模型写作,而非为人类读者写作。

克尼恩将这一现象类比为只与其他自闭症人士交流的人群。这类群体逐渐发展出一套内部沟通顺畅、但外部人员难以理解的表达方式。LLM 拥有远超人类的工作记忆,能够捕捉更细微的信息,因此在训练过程中逐渐形成一种非常适合 AI 模型理解的写作风格,但在人类读者眼中,这种表达就成了信息密度过高的堆砌。

据 IT之家了解,克尼恩认为,问题的根源在于强化学习的奖励机制。部分奖励机制着重提升 AI 模型的理解效果,另一些则注重让人类更易理解。数学和代码方面的训练越多,就越需要主动抵消这种倾向,对简洁、易读的解释给予更多奖励。

克尼恩称,Anthropic 在 Opus 5.5 上找到了更好的平衡点,“自 Opus 4.6 以来,我还没有对任何一款模型的写作表现如此满意过。”

当然,这并不意味着 Opus 5.5 已完全超越 Opus 4.6。“这是一个颇具挑战性的问题,我们将持续改进。”