中文

驭服未被发现的力量:内在知识在长上下文语言模型中的隐性影响

计算与语言 2026-02-09 v2

摘要

最近的进展在长上下文语言模型 (LCLMs) 上主要聚焦于利用外部上下文信息,往往忽略了语言模型参数化知识的影响。本文首先探讨了这种参数化知识如何影响内容生成,表明其影响随上下文长度的增加而增强。进一步地,我们展示模型利用参数化知识的能力(我们称为参数记忆能力)并不随其通过外显检索能力利用上下文知识的能力同步提升。此外,更好的外显检索能力可能会干扰模型的参数记忆能力,从而限制其潜在价值。为弥合这一差距,我们设计了一个简单而有效的混合针在haystack 测试,基于模型在两种能力上的表现进行评估,而非仅强调外显检索能力。我们的实验结果显示,Qwen-2.5 模型在 Llama-3.1 模型中显著优于后者,展示了结合各种能力的巨大潜力。更重要的是,即使是更强大的 Llama-3.1-70B-Instruct 模型也未能展现更好的表现,这凸显了从双能力视角评估模型的重要性。

关键词

引用

@article{arxiv.2504.08202,
  title  = {Harnessing the Unseen: The Hidden Influence of Intrinsic Knowledge in Long-Context Language Models},
  author = {Yu Fu and Haz Sameen Shahgir and Hui Liu and Xianfeng Tang and Qi He and Yue Dong},
  journal= {arXiv preprint arXiv:2504.08202},
  year   = {2026}
}

备注

17 pages,11figures (accepted to AAAI 2026)