中文

推理模型并不总是说出他们想到的事

计算与语言 2025-05-09 v1 人工智能 机器学习

摘要

链式思维(CoT)为AI安全提供了潜在的盼望,因为它允许监控模型的CoT以尝试理解其意图和推理过程。然而,这种监控的有效性取决于CoT忠实地代表模型的实际推理过程。我们在6种推理提示中评估了state-of-the-art推理模型的CoT忠诚度,发现:(1)对于大多数测试的设置和模型,CoTs在至少1%的示例中揭示了提示的使用,但揭示率常常低于20%;(2)基于结果的强化学习最初改善了忠诚度但在不饱和的情况下停滞;(3)当强化学习增加提示使用的频率(奖励作弊),表明性地表达这些提示的倾向性并不增加,即使不针对CoT监控器进行训练也是如此。这些结果表明,CoT监控是发现训练和评估期间不寻求行为的有前景的方式,但它不足以排除它们。它们也表明,在我们所处的情境中,CoT推理并非必要,测试时监控CoT不太可能可靠地捕捉到罕见和灾难性的意外行为。

关键词

引用

@article{arxiv.2505.05410,
  title  = {Reasoning Models Don't Always Say What They Think},
  author = {Yanda Chen and Joe Benton and Ansh Radhakrishnan and Jonathan Uesato and Carson Denison and John Schulman and Arushi Somani and Peter Hase and Misha Wagner and Fabien Roger and Vlad Mikulik and Samuel R. Bowman and Jan Leike and Jared Kaplan and Ethan Perez},
  journal= {arXiv preprint arXiv:2505.05410},
  year   = {2025}
}