全注意力的银弹或妥协?基于 gist token 的上下文压缩综合研究
计算与语言
2024-12-24 v1
摘要
本文对基于 gist 的上下文压缩方法进行彻底的调查,以改进大型语言模型中的长上下文处理。我们关注两个关键问题:(1) 这些方法能多好地替代全注意力模型?;(2) 由于压缩,可能出现哪些潜在失败模式?通过大量实验,我们展示,尽管 gist 压缩方法在诸如检索增强生成和长文档问答等任务上可实现接近无损的性能,但在合成召回等任务中面临挑战。此外,我们识别出三种关键的失败模式:边界丢失、惊讶丢失、沿途丢失。为缓解这些问题,我们提出两种有效策略:细粒度自编码,通过增强对原始 token 信息的重建;基于 token 依赖性的分段 token 重要性估计,通过调整优化来应对这些问题。我们的工作为理解基于 gist token 的上下文压缩提供了宝贵的见解,并为提高压缩能力提供了实用策略。
引用
@article{arxiv.2412.17483,
title = {A Silver Bullet or a Compromise for Full Attention? A Comprehensive Study of Gist Token-based Context Compression},
author = {Chenlong Deng and Zhisong Zhang and Kelong Mao and Shuaiyi Li and Xinting Huang and Dong Yu and Zhicheng Dou},
journal= {arXiv preprint arXiv:2412.17483},
year = {2024}
}