中文

表示偏移:将标记压缩与FlashAttention统一

计算机视觉与模式识别 2025-08-04 v1

摘要

Transformer在视觉、语言和视频领域展现出显著的成功。然而,随着任务复杂度的增加,模型变大、标记增多,导致自注意力的二次计算成本以及GPU内存访问的开销增加。为了降低自注意力的计算成本,先前的方法提出了标记压缩技术,通过丢弃冗余或信息不足的标记来实现。同时,FlashAttention等融合注意力内核通过避免注意力图的构建及其随后的HBM I/O来缓解内存开销。然而,这使得大多数无训练标记压缩方法不兼容,因为这些方法依赖注意力图来确定标记重要性。本文提出表示偏移(Representation Shift),一种无需训练、模型无关的度量方法,用于衡量每个标记表示的变化程度。这一方法无缝地将标记压缩与FlashAttention集成,无需注意力图或重新训练。我们的 метод进一步扩展到CNN和状态空间模型。广泛的实验表明,表示偏移能够实现与FlashAttention兼容的有效标记压缩,在视频-文本检索和视频问答中分别实现最高可达5.5%和4.4%的显著加速。代码可在https://github.com/mlvlab/Representation-Shift获取。

关键词

引用

@article{arxiv.2508.00367,
  title  = {Representation Shift: Unifying Token Compression with FlashAttention},
  author = {Joonmyung Choi and Sanghyeok Lee and Byungoh Ko and Eunseo Kim and Jihyung Kil and Hyunwoo J. Kim},
  journal= {arXiv preprint arXiv:2508.00367},
  year   = {2025}
}

备注

International Conference on Computer Vision (ICCV), 2025