用于视频识别的视听 SlowFast 网络
计算机视觉与模式识别
2020-03-10 v2
摘要
我们提出视听 SlowFast 网络(Audiovisual SlowFast Networks),一种用于集成视听感知的架构。AVSlowFast 具有 Slow 与 Fast 视觉通路,它们与一条 Faster 音频通路深度整合,以统一表征对视觉与声音建模。我们在多个层级融合音频与视觉特征,使音频有助于形成分层视听概念。为克服因音频与视觉模态学习动态不同而产生的训练困难,我们引入 DropPathway,在训练期间随机丢弃音频通路,作为一种有效的正则化技术。受先前神经科学研究的启发,我们进行分层视听同步以学习联合视听特征。我们在六个视频动作分类与检测数据集上报告了当前最优(state-of-the-art)结果,进行了详细的消融研究,并展示了 AVSlowFast 学习自监督视听特征的泛化能力。代码将发布于:https://github.com/facebookresearch/SlowFast。
引用
@article{arxiv.2001.08740,
title = {Audiovisual SlowFast Networks for Video Recognition},
author = {Fanyi Xiao and Yong Jae Lee and Kristen Grauman and Jitendra Malik and Christoph Feichtenhofer},
journal= {arXiv preprint arXiv:2001.08740},
year = {2020}
}
备注
Technical report