中文

MixRea:大型语言模型中显式-隐式推理的基准评测

计算与语言 2026-05-20 v1

摘要

大型语言模型(LLMs)正越来越多地融入高风险决策中。受人类认知中“无意视盲”理论的启发,我们研究 LLMs 是否表现出类似的局限性:在明确的指令下,未能注意到微妙但重要的上下文线索。为了评估这一点,我们引入了显式-隐式推理任务,并提出了 MixRea,一个包含 2,246 道多项选择题的基准,涵盖 9 种推理类型,具有不同的显式和隐式信息分布。对 21 个先进 LLMs 的评估显示,即使是表现最好的推理模型(Gemini 2.5 Pro)也仅达到 42.8% 的一致性,揭示了普遍存在的无意视盲现象。为了缓解这一问题,我们提出了潜在关系补全提示(PRCP),这是一种通过恢复被忽视的因果关系来改进推理的提示方法。进一步分析表明,这种局限性在多种多源推理任务中持续存在,凸显了对更具认知对齐性的模型的需求。

关键词

引用

@article{arxiv.2605.20128,
  title  = {MixRea: Benchmarking Explicit-Implicit Reasoning in Large Language Models},
  author = {Yuanqing Cai and Ziyi Huang and Minhao Liu and Lixin Duan and Wen Li and Yanru Zhang},
  journal= {arXiv preprint arXiv:2605.20128},
  year   = {2026}
}

备注

12 pages, 6 figures, 4 tables