中文

论LLM在反事实推理中的资格:一种分解性研究

人工智能 2026-02-17 v2

摘要

反事实推理已成为通用于大型语言模型(LLM)推理能力泛化的关键技术。通过生成和分析反事实情景,研究人员可以评估模型决策的适应性和可靠性。尽管先前的工作表明LLM在反事实推理方面常常表现不佳,但究竟哪些因素在不同任务和模态之间起最主要的制约作用,仍不明确。本文提出了一种分解策略,将反事实生成从因果构建到对反事实干预的推理分解。为支持分解性分析,我们调查了跨越自然语言理解、数学、编程和视觉语言任务等多样任务的数据集。通过广泛的评估,我们在每个分解阶段描述了LLM行为,并识别了模态类型和中间推理如何影响性能。通过建立用于分析反事实推理的结构化框架,本工作为开发更可靠的基于LLM的推理系统并为未来的诱发策略提供了指导。

关键词

引用

@article{arxiv.2505.11839,
  title  = {On the Eligibility of LLMs for Counterfactual Reasoning: A Decompositional Study},
  author = {Shuai Yang and Qi Yang and Luoxi Tang and Yuqiao Meng and Nancy Guo and Jeremy Blackburn and Zhaohan Xi},
  journal= {arXiv preprint arXiv:2505.11839},
  year   = {2026}
}

备注

ICLR 2026