结合语言与人体注视的视频中物体指代
计算机视觉与模式识别
2018-04-05 v2
摘要
我们研究物体指代(OR)问题,即在带有语言描述的视觉场景中定位目标物体。人类感知世界更多是作为连续的视频片段而非静态图像,并且不仅通过外观,还通过时空上下文和运动特征来描述物体。人类在发出指代表达时也会注视该物体。现有的OR工作大多仅关注静态图像,难以提供诸多此类线索。本文解决结合语言与人体注视的视频中OR问题。为此,我们提出一个新的OR视频数据集,包含5000段立体视频序列中标注了描述与注视的30000个物体。我们进一步提出一种新颖的视频OR网络模型,将外观、运动、注视和时空上下文整合到单一网络中。实验结果表明,我们的方法有效利用了运动线索、人体注视和时空上下文。我们的方法优于以往的OR方法。数据集与代码请参考 https://people.ee.ethz.ch/~arunv/ORGaze.html。
引用
@article{arxiv.1801.01582,
title = {Object Referring in Videos with Language and Human Gaze},
author = {Arun Balajee Vasudevan and Dengxin Dai and Luc Van Gool},
journal= {arXiv preprint arXiv:1801.01582},
year = {2018}
}
备注
Accepted to CVPR 2018, 10 pages, 6 figures