中文

追踪知识传播的极限:LLM 在冲突知识多步推理中的失败

人工智能 2026-01-23 v1 计算与语言

摘要

缓解大语言模型(LLM)中过时或错误信息的一种常见方法是通过上下文提供更新的事实或进行知识编辑。然而,当知识更新未能覆盖模型的参数化知识时,这些方法会引入知识冲突,并传播至错误的推理。但目前针对该问题的基准测试主要侧重于单次知识更新和事实召回,而未评估这些更新如何影响下游推理。在本工作中,我们引入了 TRACK(Testing Reasoning Amid Conflicting Knowledge),这是一个新的基准测试,用于研究当新知识与模型初始参数化知识冲突时,LLM 如何通过多步推理传播新知识。TRACK 涵盖三个推理密集型场景(WIKI、CODE 和 MATH),引入了多重现实冲突以反映现实世界的复杂性。我们在 TRACK 上的结果表明,与不提供更新事实相比,为模型提供更新事实进行推理可能会降低性能,并且随着提供更多更新事实,这种性能退化会加剧。我们证明,这种失败既源于无法忠实地整合更新的事实,也源于即使知识被整合后仍存在推理缺陷。TRACK 提供了一个严谨的新基准测试,以衡量和指导未来在多步推理中传播冲突知识方面的进展。

关键词

引用

@article{arxiv.2601.15495,
  title  = {Tracking the Limits of Knowledge Propagation: How LLMs Fail at Multi-Step Reasoning with Conflicting Knowledge},
  author = {Yiyang Feng and Zeming Chen and Haotian Wu and Jiawei Zhou and Antoine Bosselut},
  journal= {arXiv preprint arXiv:2601.15495},
  year   = {2026}
}

备注

Accepted to EACL 2026 (Main)