大语言模型中超长上下文阅读理解的动态分块与选择
计算与语言
2025-06-04 v2
摘要
大语言模型(LLMs)通常难以准确阅读和理解极长的文本。当前的改进方法通常依赖于将长上下文分割为固定长度的块。然而,固定截断有分离语义相关内容的风险,导致歧义并影响准确理解。为了克服这一限制,我们提出了一种简单直接的方法,用于动态分离和选择长上下文的块,为 LLMs 提供更精简的输入。具体而言,我们计算相邻句子之间的语义相似度,利用较低的相似度自适应地将长上下文划分为可变长度的块。我们进一步训练了一个问题感知分类器,以选择对回答特定问题至关重要的敏感块。在单跳和多跳问答基准上的实验结果表明,所提出的方法始终优于强基线。值得注意的是,它在广泛的输入长度范围内保持鲁棒性,能够处理多达 256k tokens 的序列。我们的数据集和代码可在以下链接获取:https://github.com/ECNU-Text-Computing/DCS
引用
@article{arxiv.2506.00773,
title = {Dynamic Chunking and Selection for Reading Comprehension of Ultra-Long Context in Large Language Models},
author = {Boheng Sheng and Jiacheng Yao and Meicong Zhang and Guoxiu He},
journal= {arXiv preprint arXiv:2506.00773},
year = {2025}
}
备注
Accepted by ACL 2025 Main Conference