中文

具有特征固定的线性视频Transformer

计算机视觉与模式识别 2022-10-18 v1 多媒体

摘要

视觉Transformer在视频分类中取得了令人印象深刻的性能,却受限于Softmax注意力机制带来的二次复杂度。一些研究通过减少注意力计算中的token数量来缓解计算开销,但复杂度仍为二次。另一可行途径是以线性注意力替代Softmax注意力,其具有线性复杂度但存在明显的性能下降。我们发现线性注意力中的此类下降源于缺乏对关键特征的注意力集中。因此,我们提出特征固定模块,在计算线性注意力之前对查询与键的特征重要性进行重加权。具体地,我们将查询、键和值视为输入token的各种潜在表示,并通过聚合Query-Key-Value信息来学习特征固定比例。这有助于全面度量特征重要性。此外,我们通过邻域关联增强特征固定,利用来自空间与时间邻域token的额外引导。所提方法显著改进了线性注意力基线,并在三个流行视频分类基准上实现了线性视频Transformer中的最先进性能。凭借更少参数与更高效率,我们的性能甚至可与某些基于Softmax的二次Transformer相媲美。

关键词

引用

@article{arxiv.2210.08164,
  title  = {Linear Video Transformer with Feature Fixation},
  author = {Kaiyue Lu and Zexiang Liu and Jianyuan Wang and Weixuan Sun and Zhen Qin and Dong Li and Xuyang Shen and Hui Deng and Xiaodong Han and Yuchao Dai and Yiran Zhong},
  journal= {arXiv preprint arXiv:2210.08164},
  year   = {2022}
}