中文

AbsenceBench:大语言模型无法辨认缺失内容

计算与语言 2025-06-16 v1

摘要

大型语言模型(LLMs)在处理长输入和定位特定信息方面日益有能力,这一点在Needle in a Haystack(NIAH)测试中便得到了证实。然而,尽管模型在 recalling惊人信息方面表现出色,但它们仍然难以识别明显被省略的信息。我们引入AbsenceBench来评估LLMs在三个领域检测缺失信息的能力:数值序列、诗歌和GitHub拉请求。AbsenceBench要求模型识别给定原始和编辑上下文中被故意删除的文档片段。尽管这些任务看起来似乎相当直接,但我们的实验显示,即使是Claude-3.7-Sonnet等最先进的模型也仅实现69.6%的F1分数,平均上下文长度为5K token。我们的分析表明,这种差労的性能源于一个根本性的局限:Transformer注意力机制难以关注文档中的“间隙”,因为这些缺失不对应于可以被关注的特定键。总体而言,我们的结果和分析为模型已实现超人能力的任务(NIAH)和意外崩溃的任务(AbsenceBench)之间的紧密 Proximity 提供了一个案例研究。

关键词

引用

@article{arxiv.2506.11440,
  title  = {AbsenceBench: Language Models Can't Tell What's Missing},
  author = {Harvey Yiyun Fu and Aryan Shrivastava and Jared Moore and Peter West and Chenhao Tan and Ari Holtzman},
  journal= {arXiv preprint arXiv:2506.11440},
  year   = {2025}
}

备注

23 pages, 8 figures. Code and data are publicly available at https://github.com/harvey-fin/absence-bench