中文

探析大规模推理模型的认知习惯

计算与语言 2025-07-08 v2 人工智能 密码学与安全

摘要

大规模推理模型(LRM)能够在生成最终响应前自主产生推理链(Chain of Thought, CoT),为解释和监控模型行为提供了有前景的方案。灵感来源于观察到某些 CoT 模式(如“Wait, did I miss anything?”)在不同任务中反复出现,我们探讨 LRM 是否展现出类人认知习惯。基于“认知习惯”(Habits of Mind)这一人类成功解决问题的经典认知习惯框架,我们引入 CogTest,一个原则化的基准测试,用于评估 LRM 的认知习惯。CogTest 包含 16 项认知习惯,每个习惯配备 25 个多样化任务,并采用证据优先提取方法确保习惯识别的可靠性。借助 CogTest,我们对 16 个广泛使用的 LLM(13 个 LRM 和 3 个非推理模型)进行了全面评估。我们的发现表明,LRM 与传统 LLM 不同,不仅展现出类人习惯,而且会根据不同任务灵活部署。更细粒度的分析进一步揭示了 LRM 认知习惯配置之间的相似性与差异性,尤其是某些模型内部家族间的相似性(如 Qwen-3 模型与 DeepSeek-R1)。将研究扩展至安全相关任务时,我们观察到某些习惯(如“负责任地冒险”)与生成有害响应密切相关。这些发现表明,研究 LRM CoT 中持续的行为模式是深入理解 LLM 异常行为的重要一步。代码已公开:https://github.com/jianshuod/CogTest。

关键词

引用

@article{arxiv.2506.21571,
  title  = {Towards Understanding the Cognitive Habits of Large Reasoning Models},
  author = {Jianshuo Dong and Yujia Fu and Chuanrui Hu and Chao Zhang and Han Qiu},
  journal= {arXiv preprint arXiv:2506.21571},
  year   = {2025}
}