用于动作驱动视频目标检测的时间动态图LSTM
计算机视觉与模式识别
2017-08-03 v1
摘要
本文研究一种弱监督目标检测框架。大多数现有框架专注于使用静态图像来学习目标检测器。然而,这些检测器常因存在的域偏移而无法推广到视频。因此,我们研究直接从日常活动的冗长视频中学习这些检测器。我们探索使用动作描述作为监督,而非边界框,因为它们相对容易收集。然而,一个常见问题是,未参与人类动作的兴趣对象常缺席于被称为“缺失标签”的全局动作描述中。为应对此问题,我们提出一种新颖的时间动态图长短期记忆网络(TD-Graph LSTM)。TD-Graph LSTM通过构建基于目标提议的时间相关性并跨越整个视频的动态图,实现全局时间推理。因此,通过在整个视频中相关目标提议间传递知识,可显著缓解每帧的缺失标签问题。在大规模日常生活动作数据集(即Charades)上的广泛评估证明了我们所提方法的优越性。我们还发布了Charades中超过5,000帧的目标边界框标注。我们相信该标注数据未来也可惠及基于视频的目标识别的其他研究。
引用
@article{arxiv.1708.00666,
title = {Temporal Dynamic Graph LSTM for Action-driven Video Object Detection},
author = {Yuan Yuan and Xiaodan Liang and Xiaolong Wang and Dit-Yan Yeung and Abhinav Gupta},
journal= {arXiv preprint arXiv:1708.00666},
year = {2017}
}
备注
To appear in ICCV 2017