中文

藏在针砭之中:较小的针尖更难被 LLM 发现

计算与语言 2025-12-18 v2 人工智能 机器学习

摘要

大型语言模型(LLM)在针砭任务中面临重大挑战,这类任务要求从大量无关上下文(“针面”)中抽取相关信息(“针尖”)。先前研究已指出位置偏差和干扰项数量是影响模型性能的关键因素,但金融上下文大小(答案所在文档的长度)的影响鲜有被关注。我们进行首个系统性研究,考察金融上下文大小在长上下文问答中的影响,涵盖三个不同基准(通用知识、医学推理和数学推理)、十一种最先进的 LLM(包括最新推理模型)以及超过15万次受控实验。我们的实验揭示,LLM 在金融上下文较短时性能显著下降,即较小的金融上下文持续降低模型性能并放大位置敏感性,这对必须整合不同长度细粒度信息的智能体系统构成重大挑战。在严格的混淆因素分析下,即便控制金融上下文位置、答案标记重复、金融-干扰比、干扰量和领域特异性后,金融上下文大小仍是成功的决定性、独立预测因子。我们的工作为设计稳健、具上下文感知的 LLM 驱动系统提供了清晰见解。

关键词

引用

@article{arxiv.2505.18148,
  title  = {Hidden in the Haystack: Smaller Needles are More Difficult for LLMs to Find},
  author = {Owen Bianchi and Mathew J. Koretsky and Maya Willey and Chelsea X. Alvarado and Tanay Nayak and Adi Asija and Nicole Kuznetsov and Mike A. Nalls and Faraz Faghri and Daniel Khashabi},
  journal= {arXiv preprint arXiv:2505.18148},
  year   = {2025}
}

备注

Under Review