探究双跳潜在推理的经验教训
计算与语言
2025-11-25 v4 人工智能
摘要
大型语言模型可使用链式思维(CoT)以外部方式表达推理,从而可能使有能力的LLM代理的监督成为可能。先前的工作表明,模型在没有CoT的情况下在双跳问答方面存在困难。这种能力如此基本,以至于如果它是一个根本性限制,便意味着许多复杂的代理任务也会类似地需要CoT。我们使用双跳问答作为案例研究来探索LLM潜在推理能力。先前关于潜在与外部化双跳推理之间差距的工作结果不一致且结论不明确。本文引入了一个受控环境,用于探究LLM的双跳推理,在该环境中,积极结果可提供关于潜在推理的确定性证据。我们对LLMs(包括Llama 3 8B和GPT-4o)进行微调,使用合成事实进行测试。通过使用合成事实,我们排除了记忆和推理捷径作为双跳性能解释的可能性。我们观察到一种细致的图景:模型无法组合两个合成事实,但可以在一个事实为合成、另一个事实为自然时成功。这些结果表明,LLMs无可辩驳地具备潜在的双跳推理能力,尽管其能力随模型大小而变化尚不清楚。最后,我们为研究LLM推理的研究者提供了一个教训:在对LLM潜在推理作出结论时,必须谨慎避免两种陷阱:一种源于记忆和推理捷径的虚假成功,另一种可能源于人为实验设置(脱离前沿LLM训练环境)的虚假失败。
引用
@article{arxiv.2411.16353,
title = {Lessons from Studying Two-Hop Latent Reasoning},
author = {Mikita Balesni and Tomek Korbak and Owain Evans},
journal= {arXiv preprint arXiv:2411.16353},
year = {2025}
}