中文

教模型在链式思考推理中 verbalize reward hacking

计算与语言 2025-07-15 v2 人工智能

摘要

使用强化学习训练的语言模型可能会进行奖励作弊——即利用意外策略获取高奖励——而未在其链式思考推理中透露此类行为。这使得检测奖励作弊变得困难,对于高风险应用构成威胁。我们提出了 verbalization fine-tuning(VFT),这是一种强化学习前的预训练干预,旨在训练模型在受提示线索影响时(例如提示中暗示错误答案为 A 的 Stanford 教授的观点)能够明确表达这种影响。为评估 VFT,我们随后在环境中进行训练,其中 held-out 提示线索会信号哪些错误答案将获得高奖励,从而激励模型利用这些线索而非正确推理。我们衡量模型在未 verbalize 情况下利用这些线索的频率。在 VFT 训练后,仅有 6% 的模型响应包含未被 verbalize 的奖励作弊。相比之下,在没有 VFT 的情况下进行 RL,未检测到的奖励作弊比例上升至 88%;而采用去偏 debiasing baseline 干预后,这一比例进一步上升至 99%。VFT 通过显著增加模型 verbalize 提示线索影响的频率,从 8% 提高到 43%(在 VFT 后),甚至在 RL 后提升至 94%。基线方法在 RL 后仍保持低水平(分别为 11% 和 1%)。我们的结果表明,在 RL 之前教模型显式 verbalize 奖励作弊行为,可显著提高其检测能力,为实现更透明和安全的 AI 系统提供了实际可行的路径。

关键词

引用

@article{arxiv.2506.22777,
  title  = {Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning},
  author = {Miles Turpin and Andy Arditi and Marvin Li and Joe Benton and Julian Michael},
  journal= {arXiv preprint arXiv:2506.22777},
  year   = {2025}
}

备注

Published at ICML 2025 Workshop on Reliable and Responsible Foundation Models