从推理路径聚合的视角理解语言模型的推理能力
机器学习
2024-06-24 v3 人工智能
计算与语言
摘要
预训练语言模型(LM)能够在没有显式微调的情况下执行复杂推理。为了理解以预测下一个词为目标的预训练如何促成这种推理能力的涌现,我们提出可以将 LM 视为通过聚合在预训练时见过的间接推理路径来推导出新结论。我们发现这一视角在两种重要的推理情形中有效:基于知识图谱(KG)的逻辑推理和思维链(CoT)推理。更具体地说,我们将推理路径形式化为知识/推理图上的随机游走路径。对学习到的 LM 分布的分析表明,相关随机游走路径概率的加权和是解释 LM 如何推理的一种合理方式。在多个 KG 和 CoT 数据集上的实验和分析揭示了在随机游走路径上训练的效果,并表明增强无标签的随机游走推理路径可以提高现实世界的多步推理性能。代码:https://github.com/WANGXinyiLinda/LM_random_walk
引用
@article{arxiv.2402.03268,
title = {Understanding Reasoning Ability of Language Models From the Perspective of Reasoning Paths Aggregation},
author = {Xinyi Wang and Alfonso Amayuelas and Kexun Zhang and Liangming Pan and Wenhu Chen and William Yang Wang},
journal= {arXiv preprint arXiv:2402.03268},
year = {2024}
}
备注
Accepted to ICML 2024