听我说:用于音频增强时序动作定位的融合方法
计算机视觉与模式识别
2021-10-19 v4 多媒体
摘要
最先进的未剪辑视频时序动作定位(TAL)架构仅考虑了RGB与光流模态,完全未利用信息丰富的音频模态。音频融合已在相关但相对更易的剪辑级(片段级)动作识别问题中被探索。然而,TAL带来了一组独特的挑战。本文中,我们提出简单而有效的基于融合的TAL方法。据我们所知,我们的工作是首个为监督式TAL联合考虑音频与视频模态。我们通过实验表明,我们的方案持续提升了最先进的纯视频TAL方法的性能。具体而言,它们有助于在大规模基准数据集ActivityNet-1.3(54.34 [email protected])和THUMOS14(57.18 [email protected])上取得新的SOTA性能。我们的实验包括涉及多种融合方案、模态组合与TAL架构的消融研究。我们的代码、模型及相关数据可在 https://github.com/skelemoa/tal-hmo 获取。
引用
@article{arxiv.2106.14118,
title = {Hear Me Out: Fusional Approaches for Audio Augmented Temporal Action Localization},
author = {Anurag Bagchi and Jazib Mahmood and Dolton Fernandes and Ravi Kiran Sarvadevabhatla},
journal= {arXiv preprint arXiv:2106.14118},
year = {2021}
}