QUITO-X:基于信息瓶颈理论的上下文压缩新视角
计算与语言
2025-10-14 v3 人工智能
摘要
生成式大语言模型(LLM)凭借其有前景的上下文学习能力,在各种工业应用中取得了显著成功。然而,复杂任务中的长上下文问题对其更广泛的采用构成了重大障碍,主要体现在两个方面:(i)过长的上下文导致高成本和推理延迟;(ii)长上下文引入的大量与任务无关的信息加剧了“中间迷失”问题。现有方法通过使用诸如自信息或困惑度(PPL)等指标去除冗余标记来压缩上下文,这与在给定查询条件下保留最重要标记的目标不一致。在本研究中,我们引入信息瓶颈理论(IB)对该问题进行建模,为上下文压缩所需的基本属性提供了新颖的视角。此外,我们提出了一种基于交叉注意力的方法来近似IB中的互信息,该方法可在不同场景下灵活替换为其他合适的替代方案。在四个数据集上的大量实验表明,与最先进方法相比,我们的方法在保持问答性能的同时,压缩率提高了25%。特别是,在某些情况下,我们方法压缩后的上下文甚至优于完整上下文。
关键词
引用
@article{arxiv.2408.10497,
title = {QUITO-X: A New Perspective on Context Compression from the Information Bottleneck Theory},
author = {Yihang Wang and Xu Huang and Bowen Tian and Yueyang Su and Lei Yu and Huaming Liao and Yixing Fan and Jiafeng Guo and Xueqi Cheng},
journal= {arXiv preprint arXiv:2408.10497},
year = {2025}
}