中文

SSAN:用于视频表征学习的可分离自注意力网络

计算机视觉与模式识别 2021-05-28 v1

摘要

自注意力因在建模长程依赖上的有效性已成功应用于视频表征学习。现有方法仅通过同时沿空间和时间维度计算两两相关性来建立依赖关系。然而,空间相关性与时间相关性代表了场景的不同上下文信息以及时间推理。直观上,先学习空间上下文信息将有益于时间建模。本文中,我们提出可分离自注意力(SSA)模块,其顺序建模空间与时间相关性,从而使空间上下文能高效用于时间建模。通过将SSA模块加入2D CNN,我们构建了用于视频表征学习的SSA网络(SSAN)。在视频动作识别任务上,我们的方法在Something-Something和Kinetics-400数据集上优于SOTA方法。我们的模型常以更浅网络和更少模态超越对应方法。我们进一步在视频检索的视觉-语言任务中验证了方法的语义学习能力,展示了视频表征与文本嵌入的同质性。在MSR-VTT和Youcook2数据集上,由SSA学习的视频表征显著提升了SOTA性能。

关键词

引用

@article{arxiv.2105.13033,
  title  = {SSAN: Separable Self-Attention Network for Video Representation Learning},
  author = {Xudong Guo and Xun Guo and Yan Lu},
  journal= {arXiv preprint arXiv:2105.13033},
  year   = {2021}
}

备注

Accepted by CVPR2021