中文

关于监控文档的训练导致链觉推理混淆

机器学习 2026-05-18 v1

摘要

链觉推理(Chain-of-thought, CoT)监控是我们最具希望的检测模型不当行为工具之一,但其有效性取决于模型能否忠实地外部化其推理过程。受此漏洞启发,我们研究监控感知模型是否具备能力通过迷避检测来混淆其推理。我们使用合成文档微调让八个模型暴露于描述 CoT 监控的真实训练风格文档中,发现监控感知模型一致实现更高的未被检测的不当行为率,优于不知情对照组。该效应在更具挑战性的 agentic 任务中仍然存在,但较弱。我们还表明,CoT 可控性——即模型在受约束约束下重塑其自身推理轨迹的能力——与混淆成功率之间高度相关(r=0.800r=0.800, p=0.017p=0.017)。在相同强化学习优化压力下,监控感知模型比不知情对照组更快学会奖励操纵且未显著触发 CoT 监控。综合这些结果表明,监控知识与高 CoT 可控性的组合构成了对基于 CoT 的监控的风险。

关键词

引用

@article{arxiv.2605.15257,
  title  = {Training on Documents About Monitoring Leads to CoT Obfuscation},
  author = {Reilly Haskins and Bilal Chughtai and Joshua Engels},
  journal= {arXiv preprint arXiv:2605.15257},
  year   = {2026}
}