第一滴墨水:误导性信息在长上下文推理中的非线性影响
人工智能
2026-05-12 v1
摘要
随着大型语言模型在检索增强生成和智能体系统中不断部署用于累积大量上下文,理解干扰信息如何影响长上下文性能变得至关重要。先前研究表明,语义相关但误导性的文档会降低性能,但干扰物比例与性能之间的定量关系尚未得到研究。在本工作中,我们系统性地变更固定长度上下文中硬干扰物的比例,揭示了惊人的非线性模式:随着硬干扰物比例增加,性能在前小部分范围内急剧下降,而其余范围仅产生边际性的额外下降。我们称之为"第一滴墨水效应",类似于单滴墨水污染水中的作用。我们对注意力机制进行的理论与实证分析表明,硬干扰物即使在小比例下也能捕获不成比例的注意力,而随着比例增大,其边际影响逐渐减弱。受控实验进一步显示,过滤获益主要来自上下文长度的减少而非干扰物的移除;要实现显著恢复,需将硬干扰物比例降至接近零,突显了上游检索精度的重要性。
引用
@article{arxiv.2605.10828,
title = {The First Drop of Ink: Nonlinear Impact of Misleading Information in Long-Context Reasoning},
author = {Muhan Gao and Zih-Ching Chen and Kuan-Hao Huang},
journal= {arXiv preprint arXiv:2605.10828},
year = {2026}
}