在线向量量化注意力
机器学习
2026-05-18 v3
摘要
语言模型中使用的标准序列混合层在效率和性能之间难以取得平衡。自注意力在长上下文任务中表现良好,但计算成本为二次方,线性内存成本高昂;而线性注意力和状态空间模型(SSM)仅使用线性计算和恒定内存,但在处理长上下文方面表现不佳。本文我们开发了一种序列混合层,旨在在内存-计算成本和长上下文处理之间寻找更好的折中方案,我们称之为在线向量量化(OVQ)注意力。OVQ注意力需要线性计算成本和恒定内存,但与线性注意力和SSM不同,它使用稀疏内存更新,使其能够大幅增加内存状态的大小,从而提高内存容量。我们基于高斯混合回归开发了OVQ注意力的理论基础,并在各种合成长上下文任务和长上下文语言建模上进行测试。OVQ注意力在多个基准上显著优于线性注意力基线和原型VQ注意力,后者是OVQ注意力的灵感来源。它在最高达 64k 序列长度的情况下,展现出与强大的自注意力基线相当,甚至完全相同的性能,尽管仅使用了完整自注意力内存的很小比例。
引用
@article{arxiv.2602.03922,
title = {Online Vector Quantized Attention},
author = {Nick Alonso and Tomas Figliolia and Beren Millidge},
journal= {arXiv preprint arXiv:2602.03922},
year = {2026}
}