基于跨模态注意力的双流视频分类
计算机视觉与模式识别
2019-08-02 v1
摘要
众所周知,融合多模态信息能够有效且显著地提升视频分类性能。然而,迄今为止最流行的方法仍然只是在最后阶段简单地融合每个流的预测分数。一个合理的问题是,是否存在一种更有效的方法来跨模态融合信息。随着注意力机制在自然语言处理中的发展,注意力在计算机视觉领域涌现出许多成功的应用。在本文中,我们提出了一种跨模态注意力操作,它能够以比双流方法更有效的方式从其他模态获取信息。相应地,我们实现了一个名为 CMA 块的兼容模块,它是我们所提出的注意力操作的一个封装器。CMA 可以插入到许多现有的架构中。在实验中,我们将我们的方法与视频分类中广泛使用的双流模型和非局部模型进行了全面比较。所有实验都清楚地证明了我们提出的方法具有强大的性能优势。我们还通过可视化注意力图来分析 CMA 块的优势,直观地展示了该块如何辅助最终预测。
引用
@article{arxiv.1908.00497,
title = {Two-Stream Video Classification with Cross-Modality Attention},
author = {Lu Chi and Guiyu Tian and Yadong Mu and Qi Tian},
journal= {arXiv preprint arXiv:1908.00497},
year = {2019}
}
备注
12 pages, 7 figures