中文

知识还是推理?跨领域细看 LLM 的思维过程

计算与语言 2025-06-04 v1

摘要

诸如 OpenAI-o1/3 和 DeepSeek-R1 等推理增强型大语言模型(LLM)的最新进展,显著提升了其在复杂任务上的表现。然而,其内部推理过程的质量和透明度仍有待深入探索。本研究超越了最终答案的准确性,通过将思维轨迹显式分解为两部分——知识与推理,调查了医学和数学领域中的逐步推理过程。具体而言,我们引入了一个细粒度评估框架,评判:(1)所用知识的正确性(由知识指数(Knowledge Index, KI)衡量)以及(2)推理质量(由信息增益(Information Gain, InfoGain)衡量)。利用该框架,我们研究了在医学和数学领域通过监督微调(SFT)和/或强化学习(RL)训练的 R1 蒸馏模型和基础 Qwen 模型。得出了三个有趣的发现:(1)R1 蒸馏模型中的通用推理能力,无论是通过 SFT 还是 RL,均未能有效迁移至医学领域。(2)SFT 提高了两个领域的最终答案准确率,但往往以牺牲推理质量为代价:与未训练模型相比,InfoGain 平均下降 38.9%;然而在医学领域,SFT 仍然至关重要,因为领域知识不可或缺。(3)RL 通过从推理路径中剔除不准确或无关的知识来增强医学推理,从而同时提高了推理准确率和知识正确性。

关键词

引用

@article{arxiv.2506.02126,
  title  = {Knowledge or Reasoning? A Close Look at How LLMs Think Across Domains},
  author = {Juncheng Wu and Sheng Liu and Haoqin Tu and Hang Yu and Xiaoke Huang and James Zou and Cihang Xie and Yuyin Zhou},
  journal= {arXiv preprint arXiv:2506.02126},
  year   = {2025}
}

备注

17 pages, preprint