中文

面向 Transformer 的数据感知随机特征核

机器学习 2026-03-05 v1 人工智能

摘要

Transformer 在多个领域表现出色,但其二次注意力复杂度是扩缩放的瓶颈。Performers 等基于随机特征的注意力机制可将此类成本降低为序列长度的线性复杂度,通过从各向同性分布中抽取的正随机特征来逼近 softmax 核。在预训练模型中,查询和键通常呈各向异性,这会导致各向同性抽样方案在蒙特卡洛抽样方差较高,除非重新训练模型或使用较大的特征预算。重要性抽样可通过适应输入几何来调整抽样分布以解决此问题,但复杂的数据依赖提议分布往往难以实现。我们表明,通过数据对齐 softmax 核,可获得一种注意力机制,既能容纳可求解的最小方差提议分布进行重要性抽样,又具有更好的训练稳定性。基于此发现,我们引入 DARKFormer,一种数据感知随机特征核 Transformer,特点是数据对齐的核几何。DARKFormer 学习随机投影协方差,高效实现其数据对齐核的重要性抽样正随机特征估计器。实验表明,DARKFormer 在缩小与精确 softmax 注意力之间的性能差距方面尤为有效,特别是在预训练表示呈各向异性的微调阶段。通过将随机特征效率与数据感知核结合,DARKFormer 为资源受限环境下的基于核的注意力提供了新的进展。

关键词

引用

@article{arxiv.2603.04127,
  title  = {Data-Aware Random Feature Kernel for Transformers},
  author = {Amirhossein Farzam and Hossein Mobahi and Nolan Andrew Miller and Luke Sernau},
  journal= {arXiv preprint arXiv:2603.04127},
  year   = {2026}
}