中文

用于视频识别的视听 SlowFast 网络

计算机视觉与模式识别 2020-03-10 v2

摘要

我们提出视听 SlowFast 网络(Audiovisual SlowFast Networks),一种用于集成视听感知的架构。AVSlowFast 具有 Slow 与 Fast 视觉通路,它们与一条 Faster 音频通路深度整合,以统一表征对视觉与声音建模。我们在多个层级融合音频与视觉特征,使音频有助于形成分层视听概念。为克服因音频与视觉模态学习动态不同而产生的训练困难,我们引入 DropPathway,在训练期间随机丢弃音频通路,作为一种有效的正则化技术。受先前神经科学研究的启发,我们进行分层视听同步以学习联合视听特征。我们在六个视频动作分类与检测数据集上报告了当前最优(state-of-the-art)结果,进行了详细的消融研究,并展示了 AVSlowFast 学习自监督视听特征的泛化能力。代码将发布于:https://github.com/facebookresearch/SlowFast。

关键词

引用

@article{arxiv.2001.08740,
  title  = {Audiovisual SlowFast Networks for Video Recognition},
  author = {Fanyi Xiao and Yong Jae Lee and Kristen Grauman and Jitendra Malik and Christoph Feichtenhofer},
  journal= {arXiv preprint arXiv:2001.08740},
  year   = {2020}
}

备注

Technical report