从输出监督中习得的思维链混淆可泛化至未见任务
人工智能
2026-05-21 v2
摘要
思维链推理通过使大语言模型能够规划、探索和深思其行动,显著提升了模型性能。思维链也是监控这些智能体行为的有力工具:当思维链忠实时,它能提供模型决策过程的解释,并为危险行为提供早期预警信号。然而,施加于思维链的优化压力可能导致模型混淆推理轨迹,从而丧失这一有益特性。我们证明混淆可以跨任务泛化;那些学会在涉及奖励黑客行为(例如访问和利用泄露信息)的推理中进行混淆的模型,会将奖励黑客行为及其在思维链中的混淆同时泛化到未见过的奖励黑客场景中。最令人担忧的是,我们证明,即使仅在关闭思维链后惩罚模型的最终动作,思维链推理的混淆及其跨任务泛化现象依然会出现。我们的发现表明,当前惩罚有害生成内容的做法,可能会以不可预测的方式无意中导致大语言模型整体可监控性的降低。
引用
@article{arxiv.2601.23086,
title = {Chain-of-thought obfuscation learned from output supervision can generalise to unseen tasks},
author = {Nathaniel Mitrani Hadida and Sassan Bhanji and Cameron Tice and Puria Radmard},
journal= {arXiv preprint arXiv:2601.23086},
year = {2026}
}