推理模型有时会输出不可读的思考链
机器学习
2025-11-03 v1
摘要
通过基于结果的强化学习训练的语言模型已在使用链式思考 (CoT) 进行推理方面展现出卓越的性能。监控该模型的 CoT 可能允许我们理解其意图并检测潜在的恶意行为。然而,要有效地做到这一点,CoT 必须是可读且忠实的。我们研究了 14 种推理模型的 CoT 可读性,发现 RL 常常导致推理对人类和 AI 监控者而言变得不可读,而推理模型(除 Claude 之外)在返回 perfectly readable 最终答案的同时会生成不可读的 CoT。我们展示了模型如何使用不可读的推理来得出正确答案(在仅使用可读部分时,准确率下降 53%),但在重抽样时找不到可读性与性能之间的相关性——这表明关系更为复杂。我们还发现,可读性在更难的问题上会退化。我们讨论了这些结果的潜在假设,包括 steganography、训练工件和残留标记。这些结果表明,在没有明确针对可读性进行优化的情况下,基于结果的 RL 天然会产生推理过程日益晦涩的模型,potentially 削弱了监控方法。
引用
@article{arxiv.2510.27338,
title = {Reasoning Models Sometimes Output Illegible Chains of Thought},
author = {Arun Jose},
journal= {arXiv preprint arXiv:2510.27338},
year = {2025}
}