如果你只需要检索,那么这真的算长上下文吗?关于真正困难长上下文 NLP 的探讨
计算与语言
2025-07-08 v4 人工智能
摘要
语言模型能力的提升正推动其应用向更长的上下文发展,使得长上下文评估与开发成为活跃的研究领域。然而,许多不同用例被归类为“长上下文”,其定义仅以模型输入的总长度为准,包括针对 Needle-in-a-Haystack 任务、书籍摘要和信息聚合等场景。鉴于其难度差异大,本立场论文认为,仅凭上下文长度将不同任务归为一类是没有帮助的。作为学术界,我们需要更精确的词汇来理解什么使得长上下文任务相似或不同。我们提出基于使任务更具难度特性的属性来细化长上下文分类法。我们提出两个正交的难度维度:(I) 扩散性:在上下文中寻找必要信息的难度如何?(II) 范围性:需要寻找的必要信息有多少?我们调查了长上下文文献,为该分类法提供论证,并将其在该框架下的文献定位。我们得出结论,那些必要信息极其冗长且高度分散的情境,严重缺乏探索。通过采用描述性词汇并讨论长上下文中难度的相关特性,我们可以更有针对性地开展此领域的研究。我们呼吁在设计具有明确长上下文特征的任务和基准时,必须考虑使其在本质上不同于短上下文的特性。
引用
@article{arxiv.2407.00402,
title = {Is It Really Long Context if All You Need Is Retrieval? Towards Genuinely Difficult Long Context NLP},
author = {Omer Goldman and Alon Jacovi and Aviv Slobodkin and Aviya Maimon and Ido Dagan and Reut Tsarfaty},
journal= {arXiv preprint arXiv:2407.00402},
year = {2025}
}
备注
EMNLP 2024