Transformer 在长上下文建模中的高维诅咒问题
计算与语言
2025-08-15 v4 机器学习
机器学习
摘要
基于 Transformer 的大型语言模型(LLMs)通过自注意力机制捕获长程依赖,在自然语言处理任务中表现出色。然而,由于冗余的注意力计算,长上下文建模面临显著的计算低效问题:尽管注意力权重通常是稀疏的,但所有 token 都消耗同等的计算资源。在本文中,我们将传统的概率序列建模重新表述为监督学习任务,从而能够分离相关与不相关的 token,并更清晰地理解冗余问题。基于这一重新表述,我们从理论上分析了注意力稀疏性,揭示仅有少数 token 对预测有显著贡献。在此基础上,我们将注意力优化表述为线性编码问题,并提出了一种分组编码策略,在理论上证明了其能够提升对随机噪声的鲁棒性并增强学习效率。受此启发,我们提出了动态分组注意力,利用分组编码在注意力计算过程中通过聚合不重要的 token 来显式减少冗余。实验结果表明,我们的 DGA 在保持竞争力的同时显著降低了计算成本。代码可在 https://github.com/bolixinyu/DynamicGroupAttention 获取。
引用
@article{arxiv.2505.22107,
title = {Curse of High Dimensionality Issue in Transformer for Long-context Modeling},
author = {Shuhai Zhang and Zeng You and Yaofo Chen and Zhiquan Wen and Qianyue Wang and Zhijie Qiu and Yuanqing Li and Mingkui Tan},
journal= {arXiv preprint arXiv:2505.22107},
year = {2025}
}
备注
Accepted at ICML 2025