关系型动作预测
计算机视觉与模式识别
2019-04-09 v1
摘要
本文关注视频中的多人动作预测。更确切地说,给定前 H 帧的历史,目标是检测参与者并预测其在接下来 T 帧中的未来动作。我们的方法通过使用以 Faster R-CNN 获得的参与者提议作为节点构建循环图,联合建模不同参与者之间的时间与空间交互。我们的方法学习选择一组判别性关系子集,且不需要显式监督,从而使我们能够处理具有挑战性的视觉数据。我们将我们的模型称为判别性关系循环网络(Discriminative Relational Recurrent Network, DRRN)。在 AVA 上的动作预测评估表明,与更简单的基线相比,我们提出的方法有效。此外,我们在 J-HMDB 上的早期动作分类任务上显著提升了性能,从先前 SOTA 的 48% 提升至 60%。
引用
@article{arxiv.1904.04231,
title = {Relational Action Forecasting},
author = {Chen Sun and Abhinav Shrivastava and Carl Vondrick and Rahul Sukthankar and Kevin Murphy and Cordelia Schmid},
journal= {arXiv preprint arXiv:1904.04231},
year = {2019}
}
备注
CVPR 2019 (oral)