关注与交互:用于视频理解的高阶物体交互
计算机视觉与模式识别
2018-03-22 v2
摘要
人类动作常涉及场景中对若干相互关联物体的复杂交互。然而,现有的细粒度视频理解或视觉关系检测方法通常依赖单一物体表示或成对物体关系。此外,对视频中数百帧的多个物体学习交互在计算上不可行,且由于需建模巨大的组合空间,性能可能受损。本文中,我们提出高效学习任意物体子群之间的高阶交互以用于细粒度视频理解。我们证明,建模物体交互显著提升了动作识别与视频字幕的准确性,同时相较传统成对关系节省超过3倍计算量。所提方法在两个大规模数据集上验证:Kinetics与ActivityNet Captions。我们的SINet与SINet-Caption在两个数据集上均取得最先进(SOTA)性能,尽管视频采样率最高仅为1 FPS。据我们所知,这是首个在开放域大规模视频数据集上建模物体交互的工作,且我们额外建模了高阶物体交互,以低计算成本提升了性能。
引用
@article{arxiv.1711.06330,
title = {Attend and Interact: Higher-Order Object Interactions for Video Understanding},
author = {Chih-Yao Ma and Asim Kadav and Iain Melvin and Zsolt Kira and Ghassan AlRegib and Hans Peter Graf},
journal= {arXiv preprint arXiv:1711.06330},
year = {2018}
}
备注
CVPR 2018