面向弱监督时序动作定位的跨模态共识网络
计算机视觉与模式识别
2021-07-28 v1
摘要
弱监督时序动作定位(WS-TAL)是一项具有挑战性的任务,旨在仅利用视频级类别监督在给定视频中定位动作实例。先前工作使用了外观与运动特征,但未能以恰当方式利用它们,而是采用简单的拼接或分数级融合。本文认为,从预训练提取器(如I3D)提取的特征并非WS-TAL任务特定特征,因此需要特征重校准以减少任务无关信息冗余。为此,我们提出一种跨模态共识网络(CO2-Net)来解决该问题。在CO2-Net中,我们主要引入两个相同的所提跨模态共识模块(CCM),其设计了一种跨模态注意力机制,利用主模态的全局信息与辅助模态的跨模态局部信息来滤除任务无关信息冗余。此外,我们将从一个CCM得到的注意力权重作为从另一CCM得到的注意力权重的伪目标,以维持两个CCM预测之间的一致性,形成互学习方式。最后,我们在两个常用的时序动作定位数据集THUMOS14和ActivityNet1.2上进行了大量实验来验证我们的方法并取得了最先进(state-of-the-art)结果。实验结果表明,我们提出的跨模态共识模块能为时序动作定位生成更具代表性的特征。
引用
@article{arxiv.2107.12589,
title = {Cross-modal Consensus Network for Weakly Supervised Temporal Action Localization},
author = {Fa-Ting Hong and Jia-Chang Feng and Dan Xu and Ying Shan and Wei-Shi Zheng},
journal= {arXiv preprint arXiv:2107.12589},
year = {2021}
}
备注
ACM International Conference on Multimedia, 2021