中文

思考一群人:辅助信息如何塑造LLM推理

计算与语言 2025-09-24 v1

摘要

大型语言模型(LLM)推理能力是其在复杂知识密集型领域应用的核心。在现实场景中,LLM常常与外部信息协同工作,该信息可能是有帮助的、无关的,甚至是误导性的。本文研究了此类辅助信息对具备显式逐步思考能力的LLM推理过程的因果影响。我们引入SciAux数据集,该数据集源自ScienceQA,用于系统性测试模型抵抗此类信息的鲁棒性。我们的发现表明,模型的 deliberative "思考模式"是一把双刃剑:有帮助的上下文会提高准确率,但误导性信息会导致性能恶化,而这种恶化由思考过程放大。相反,思考并未赋予模型鲁棒性,反而在提供误导性信息时强化了错误程度。这一发现突显了挑战不仅在于让模型 "思考”,而且在于赋予其评估其推理依据信息的关键判断能力。SciAux数据集可在 https://huggingface.co/datasets/billhdzhao/SciAux 提供。

关键词

引用

@article{arxiv.2509.18163,
  title  = {Thinking in a Crowd: How Auxiliary Information Shapes LLM Reasoning},
  author = {Haodong Zhao and Chenyan Zhao and Yansi Li and Zhuosheng Zhang and Gongshen Liu},
  journal= {arXiv preprint arXiv:2509.18163},
  year   = {2025}
}

备注

Work in progress