APCE:用于长上下文处理的自适应渐进式上下文扩张
计算与语言
2025-10-15 v1 人工智能
摘要
部署实用的长上下文 Transformer 模型 (LCTM) 需要解决两个关键挑战:(1) 由于自注意力呈二次增长,序列长度增加导致 KV 缓存的线性内存占用扩大;(2) ContextRot 现象——实证表明,Transformer 架构的性能随上下文长度的增加而恶化。鉴于输入两者共享相同的依赖关系,自然会提出问题:我们能否通过精准选择最重要的输入块来实现手术式的处理,从而在 (a) 减少内存占用,(b) 抑制 ContextRot 效应方面实现协同增益?本文在肯定回答此问题的同时,聚焦于长上下文摘要任务。我们提出了 APCE 作为一种基于上下文的解决方案,通过低维语义相似度匹配选择最重要的输入块。通过直接作用于输入,APCE 脱离了严格依赖底层硬件或 CUDA 环境的局限,展现出可兼容且可扩展至不同部署系统的潜力。我们的实证评估表明,与全密集基线相比,APCE 在使用仅 50%~70% 输入序列的情况下,实现了优异或相当的摘要性能,显著提升了 KV 缓存和自注意力的内存效率。我们希望我们的发现能激发进一步的研究,以发展针对 LCTM 其他相关长上下文任务的基于上下文的效率解决方案。
关键词
引用
@article{arxiv.2510.12051,
title = {APCE: Adaptive Progressive Context Expansion for Long Context Processing},
author = {Baisub Lee and Sanghyun Byun and Mohanad Odema and Jung Guack and Jacob Song and Woo Seong Chung},
journal= {arXiv preprint arXiv:2510.12051},
year = {2025}
}
备注
NeurIPS 2025 Workshop: ML For Systems