基于视频注意力与时间上下文的自我中心动作识别
计算机视觉与模式识别
2020-07-07 v1
摘要
我们展示了三星剑桥 AI 中心向 CVPR2020 EPIC-Kitchens 动作识别挑战赛的提交。在该挑战中,动作识别被设定为:给定输入的裁剪视频片段,同时预测单一的“动词”与“名词”类标签的问题。即,“动词”与“名词”共同定义一个组合式“动作”类。这一真实生活动作识别任务的挑战方面包括小而快速移动的物体、复杂的手-物交互与遮挡。我们提交方案的核心是一个近期提出的时空视频注意力模型,称为“W3”(“What-Where-When”)注意力~\cite{perez2020knowing}。我们进一步引入一种简单而有效的上下文学习机制,基于“动词”与“名词”预测分数直接从长期时间行为建模“动作”类分数。我们的方案在未使用物体特定推理或额外训练数据的情况下,于挑战指标上取得强劲表现。特别地,我们采用多模态集成的优选方案在 Seen Kitchens 测试集上取得“动词”第 2 佳位置,以及“名词”与“动作”第 3 佳位置。
引用
@article{arxiv.2007.01883,
title = {Egocentric Action Recognition by Video Attention and Temporal Context},
author = {Juan-Manuel Perez-Rua and Antoine Toisoul and Brais Martinez and Victor Escorcia and Li Zhang and Xiatian Zhu and Tao Xiang},
journal= {arXiv preprint arXiv:2007.01883},
year = {2020}
}
备注
EPIC-Kitchens challenges@CVPR 2020