中文

你的思维揭示你是谁:刻画大型推理模型的推理模式

计算与语言 2025-09-30 v1 人工智能 机器学习

摘要

当前对大型推理模型(LRMs)的比较侧重于任务准确率或推理长度等宏观统计量。不同LRMs的推理方式是否不同仍是一个开放问题。为了填补这一空白,我们提出了LLM-proposed Open Taxonomy(LOT),一种分类方法,利用生成式语言模型比较两个LRMs的推理轨迹,并用语言阐述其独特特征。LOT随后根据这些特征在LRM输出中的经验分布来建模它们如何预测推理轨迹的来源LRM。在推理轨迹数据集上迭代这一过程,产生一个可读的分类法,刻画了模型的思维方式。我们将LOT应用于比较12个开源LRMs在数学、科学和编程任务上的推理。LOT识别出它们思维中的系统性差异,在区分不同规模、基础模型族或目标领域的LRMs的推理轨迹时达到了80-100%的准确率。除了分类之外,LOT的自然语言分类法还提供了LRMs推理方式差异的定性解释。最后,在案例研究中,我们将推理差异与性能联系起来:在测试时将较小Qwen3模型的推理风格与最大Qwen3模型对齐,使其在GPQA上的准确率提高了3.3-5.7%。

关键词

引用

@article{arxiv.2509.24147,
  title  = {Your thoughts tell who you are: Characterize the reasoning patterns of LRMs},
  author = {Yida Chen and Yuning Mao and Xianjun Yang and Suyu Ge and Shengjie Bi and Lijuan Liu and Saghar Hosseini and Liang Tan and Yixin Nie and Shaoliang Nie},
  journal= {arXiv preprint arXiv:2509.24147},
  year   = {2025}
}

备注

32 pages, 28 figures