中文

唤醒 LLM 的推理潜力:评估与缓解模糊感知的细粒度流水线

计算与语言 2026-01-07 v5

摘要

大型语言模型(LLM)在接受训练时,越来越多地被教导在遇到难题时以回答“未知”来弃答。然而,我们观察到 LLM 经常滥用这一选项:即使在能够实际解决问题的情况下,它们也输出“未知”,或者它们无法理解为什么某些问题确实无法解决。我们将这种潜在能力与弃答倾向之间的不匹配形式化为“模糊感知”现象。我们引入了 WakenLLM 流水线,该流水线 (1) 提取模糊感知样本,并 (2) 衡量在刺激下有多少样本可以转化为正确答案。基于分阶段指标(TCR、OCR 等)以及准确率上限 Acc(WakenLLM),我们量化了 LLM 超越单次推理准确率的推理潜力。在六种 LLM 上的实验表明,无需进一步训练或修改参数,通过我们设计的流水线,LLM 在模糊感知样本上的准确率最高可提升 68.53%。我们进一步分析了模糊感知、从众性和退化如何随模型系列和参数规模而变化,并提供了多阶段推理工作流中的模型选择策略。最后,通过将 WakenLLM 与主流推理基线(包括基于训练和非基于训练的基线)进行比较,我们表明现有基线仅激活了 LLM 推理潜力的一小部分,指出感知感知推理是未来 LLM 设计的一个有前景的方向。代码和数据集可在 https://github.com/WakenLLMTeam/WakenLLM-toolkit 获取。

关键词

引用

@article{arxiv.2507.16199,
  title  = {Awakening LLMs' Reasoning Potential: A Fine-Grained Pipeline to Evaluate and Mitigate Vague Perception},
  author = {Zipeng Ling and Yuehao Tang and Shuliang Liu and Junqi Yang and Shenghong Fu and Chen Huang and Kejia Huang and Yao Wan and Zhichao Hou and Xuming Hu},
  journal= {arXiv preprint arXiv:2507.16199},
  year   = {2026}
}