大语言模型中‘失去中部’现象的有效方法?GM-Extract 的研究与缓解措施
计算与语言
2025-11-19 v1 人工智能
摘要
大型语言模型(LLMs)在有效利用长程上下文——“失去中部”现象——在基于检索的 LLM 应用中提出了重大挑战。为研究这一现象在现实世界应用中的影响,我们引入 GM-Extract,一个新颖的基准数据集,旨�确评估 LLM 在检索控制变量方面的性能。为准确诊断失效模式,我们提出一种简洁而优雅的评估系统,使用两种 distinct 指标:一种用于空间检索能力(Document Metric),另一种用于语义检索能力(Variable Extraction Metric)。我们对 7-8B 参数模型在两个多文档任务(键值提取和问答)上进行系统评估,仅通过改变数据在上下文窗口中的表示方式,即可显著改变检索性能。尽管未一致观察到明显的 U 型曲线,但我们的分析揭示了模型间清晰的性能模式,我们进一步将其与困惑度分数相关联。此外,我们对缓解方法的文献调查进行归类,分为两种 distinct 方法:黑箱方法和白箱方法。随后,我们将这些技术应用于我们的基准,发现其效果极其细致。我们的评估突显了这些策略在实际情境中成功改善性能的情景,以及它们导致负面影响的令人惊讶的情况,为在实践中全面理解其效用提供了依据。
关键词
引用
@article{arxiv.2511.13900,
title = {What Works for 'Lost-in-the-Middle' in LLMs? A Study on GM-Extract and Mitigations},
author = {Mihir Gupte and Eshan Dixit and Muhammad Tayyab and Arun Adiththan},
journal= {arXiv preprint arXiv:2511.13900},
year = {2025}
}
备注
To be submitted for publication