用于视频动作检测的演员条件注意力图
计算机视觉与模式识别
2020-05-12 v3
摘要
在观察包含多个演员的复杂事件时,人类并非分别评估每个演员,而是从上下文中进行推断。周围上下文为理解动作提供了必要信息。为此,我们提出用注意力模块替代感兴趣区域(RoI)池化,该模块对每个时空区域与已检测演员的相关性进行排序而非裁剪。我们称之为演员条件注意力图(ACAM),其对从整个场景提取的特征进行放大或抑制。所得的演员条件特征使模型聚焦于与所条件化演员相关的区域。对于演员定位,我们利用预训练的目标检测器,其迁移性能更优。所提模型高效,且我们的动作检测流程实现了近实时性能。在AVA 2.1和JHMDB上的实验结果表明了注意力图的有效性,在AVA上提升7 mAP,在JHMDB上提升4 mAP。
引用
@article{arxiv.1812.11631,
title = {Actor Conditioned Attention Maps for Video Action Detection},
author = {Oytun Ulutan and Swati Rallapalli and Mudhakar Srivatsa and Carlos Torres and B. S. Manjunath},
journal= {arXiv preprint arXiv:1812.11631},
year = {2020}
}
备注
WACV2020 Paper