中文

规范自校正:通过测试时优化缓解上下文奖励欺骗

计算与语言 2025-07-28 v1 人工智能

摘要

语言模型(LM)容易受到上下文奖励欺骗的影响,即它们会利用受污染或有缺陷的书面规范或评分标准中的漏洞来获取高分,而无需满足用户的真实意图。我们引入了规范自校正(SSC),这是一种新颖的测试时框架,使 LM 能够识别并纠正其自身指导规范中的缺陷。SSC 采用多步推理过程:模型首先基于可能有缺陷的规范生成响应,对其输出进行评判,然后修订规范本身以消除可利用的漏洞。随后,使用自校正后的规范生成最终更稳健的响应。在涵盖创意写作与智能体编程任务且涉及多个 LM 的实验中,我们证明,尽管模型最初在 50-70% 的情况下会钻有缺陷规范的空子,但 SSC 流程将这一脆弱性降低了 90% 以上。这种动态修复在推理时进行,无需修改权重,并能导向更稳健对齐的模型行为。代码见 https://github.com/vicgalle/specification-self-correction 。

关键词

引用

@article{arxiv.2507.18742,
  title  = {Specification Self-Correction: Mitigating In-Context Reward Hacking Through Test-Time Refinement},
  author = {Víctor Gallego},
  journal= {arXiv preprint arXiv:2507.18742},
  year   = {2025}
}

备注

Accepted to SCALR Workshop @ COLM 2025