推理还是表象?LLM中传递性推理的诊断研究
计算与语言
2024-10-29 v1
摘要
在推理基准上评估大型语言模型(LLM)展示了它们解决组合问题的能力。然而,对于这些模型是进行真正的逻辑推理还是仅仅依赖隐含线索来生成答案,我们知之甚少。在本文中,我们通过操纵两个组合数据集QASC和Bamboogle中的事实,研究了两种不同LLM架构LLaMA 2和Flan-T5的传递性推理能力。我们控制了可能影响模型性能的潜在线索,包括(a)测试输入各部分之间的词/短语重叠;(b)预训练或微调期间模型固有的知识;以及(c)命名实体。我们的研究结果表明,虽然两个模型都利用了(a),但Flan-T5对实验(b和c)表现出更强的鲁棒性,其方差小于LLaMA 2。这表明模型可能通过在已知相关数据集上进行微调而发展出对传递性的理解,我们将这一假设留待未来工作验证。
引用
@article{arxiv.2410.20200,
title = {Reasoning or a Semblance of it? A Diagnostic Study of Transitive Reasoning in LLMs},
author = {Houman Mehrafarin and Arash Eshghi and Ioannis Konstas},
journal= {arXiv preprint arXiv:2410.20200},
year = {2024}
}
备注
To appear in EMNLP Main 2024