中文

解耦链式思考推理效应:基于人类标签变异的视角

计算与语言 2026-04-21 v2

摘要

利用长链式思考(Chain-of-Thought, CoT)进行推理调优的大语言模型在单答案任务中表现突出,但其建模人类标签变异的能力——这需要捕获概率性歧义而非解决其中的歧义——仍未得到充分探索。我们通过在基于分布的任务上进行系统性解耦实验,采用交叉CoT实验来隔离推理文本的效应与模型内在先验的效应。我们观察到一种明确的“解耦机制”:尽管CoT改善了分布式对齐,但最终准确率由CoT内容决定(贡献99%的方差),而分布式排名则由模型先验决定(贡献超过80%)。逐步分析进一步表明,随着推理过程的进行,CoT对准确性的影响呈单调增长,而分布式结构主要由LLM的内在先验决定。这些发现表明,长CoT作为决策LLM的决定性因素对于顶部选项,但未能作为模糊任务中粗粒度分布校准器发挥作用。

关键词

引用

@article{arxiv.2601.03154,
  title  = {Decoupling the Effect of Chain-of-Thought Reasoning: A Human Label Variation Perspective},
  author = {Beiduo Chen and Tiancheng Hu and Caiqi Zhang and Robert Litschko and Anna Korhonen and Barbara Plank},
  journal= {arXiv preprint arXiv:2601.03154},
  year   = {2026}
}

备注

Accepted by ACL 2026 Findings, 21 pages, 10 figures