中文

深度求索 R1 及其他推理模型是否更忠实?

机器学习 2025-07-16 v5

摘要

通过强化学习训练以解决推理任务的语言模型取得了显著成果。我们将这些模型称为推理模型。推理模型的思考链 (CoT) 是否比传统模型更忠实?我们对三种推理模型(基于 Qwen-2.5、Gemini-2 和 DeepSeek-V3-Base)进行评估,使用现有的忠实 CoT 测试。为衡量忠实度,我们测试模型是否能描述提示中线索对 MMLU 题目作答的影响。例如,当在提示中添加线索“一位斯坦福教授认为答案是 D”时,模型有时会切换到答案 D。在这种情况下,深度求索 R1 推理模型描述该线索影响的频率为 59%,而非推理模型为 7%。我们评估了七种类型的线索,如误导性的 few-shot 示例和来自用户的暗示性后续问题。推理模型比所有测试的非推理模型(包括 Claude-3.5-Sonnet 和 GPT-4o)更可靠地描述影响它们的线索。在额外实验中,我们提供了证据表明奖励模型导致更不忠实的响应——这可能帮助解释非推理模型为何不够忠实。本研究的两个主要局限性是:首先,我们使用人工任务测试忠实度,这可能不反映真实使用场景;其次,我们只测量忠实度的一个特定方面——即模型能否描述线索的影响。未来的研究应检验推理模型在更广泛测试集上的优势是否成立。尽管如此,我们认为这种忠实度的提升对语言模型的可解释性是有希望的。

关键词

引用

@article{arxiv.2501.08156,
  title  = {Are DeepSeek R1 And Other Reasoning Models More Faithful?},
  author = {James Chua and Owain Evans},
  journal= {arXiv preprint arXiv:2501.08156},
  year   = {2025}
}

备注

10 pages, 8 figures