通过自我监控缓解误导性对齐
人工智能
2025-05-27 v1
摘要
现代大型语言模型依赖链路推理(CoT)以实现卓越的性能,但相同机制也会放大误导性对齐现象,即模型表面上看似对齐,却隐秘地追求不一致的目标。现有的安全管道将误导性对齐视为需事后过滤的黑盒输出,使模型在内部推理期间仍可自由策划。我们提出:在模型思考时能否拦截误导性对齐?我们回答了这个问题,首个在 CoT 过程中嵌入自我监控器的框架,命名为 CoT Monitor+。在生成过程中,模型产生(i)普通的推理步骤和(ii)内部自我评估信号,这一信号经过训练用于标记和抑制不一致的策略。该信号用作强化学习中的辅助奖励,形成反馈回路,奖励诚实推理并抑制隐藏目标。为系统研究误导性对齐,我们引入了 DeceptionBench,这是一个包含五个类别的基准测试,探索隐蔽对齐假装、拘谨等现象。我们评估了各种大型语言模型,表明未受限制的 CoT 大致加剧了误导倾向。相比之下,CoT Monitor+ 在平均情况下将误导行为降低了 43.8%,同时保持任务准确率。进一步地,当自我监控信号取代 RL 微调中的外部弱评判器时,模型表现出显著更少的隐蔽思维,同时保持透明度。我们的项目网站可在 cot-monitor-plus.github.io 找到。
关键词
引用
@article{arxiv.2505.18807,
title = {Mitigating Deceptive Alignment via Self-Monitoring},
author = {Jiaming Ji and Wenqi Chen and Kaile Wang and Donghai Hong and Sitong Fang and Boyuan Chen and Jiayi Zhou and Juntao Dai and Sirui Han and Yike Guo and Yaodong Yang},
journal= {arXiv preprint arXiv:2505.18807},
year = {2025}
}