通过检测学习判别性运动特征
计算机视觉与模式识别
2018-12-12 v1
摘要
尽管在图像领域取得巨大成功,诸如 Faster R-CNN 等现代检测模型在视频分析中的使用还远不够多。这或许是因为检测模型被设计为在单帧上操作,因而没有从视频中直接学习运动表示的机制。我们提出一种学习过程,使诸如 Faster R-CNN 的检测模型能直接从 RGB 视频数据中学习运动特征,同时针对姿态估计任务进行优化。给定一对视频帧——帧 A 与帧 B——我们迫使模型利用帧 B 的特征来预测帧 A 中的人体姿态。我们通过跨空间与时间使用可变形卷积来实现这一点。我们的网络学习从帧 B 中空间采样特征,以最大化帧 A 中的姿态检测精度。这自然促使我们的网络学习编码两帧间空间对应关系的运动偏移。我们将这些运动偏移称为 DiMoFs(判别性运动特征)。在实验中,我们表明我们的训练方案有助于学习有效的运动线索,可用于估计与定位显著的人体运动。此外,我们证明作为副产品,我们的模型还学习了导致静态图像中改进姿态检测与更好关键点跟踪的特征。最后,我们展示如何利用我们学习的模型进行时空动作定位与细粒度动作识别任务。
引用
@article{arxiv.1812.04172,
title = {Learning Discriminative Motion Features Through Detection},
author = {Gedas Bertasius and Christoph Feichtenhofer and Du Tran and Jianbo Shi and Lorenzo Torresani},
journal= {arXiv preprint arXiv:1812.04172},
year = {2018}
}