视频中的视觉关系定位
计算机视觉与模式识别
2020-07-22 v2
摘要
本文探讨了一项名为视频中视觉关系定位(vRGV)的新任务。该任务旨在以主体-谓词-客体形式在视频中时空定位给定关系,从而为其他高层视频-语言任务(如视频-语言定位与视频问答)提供支撑性视觉事实。该任务的挑战包括但不限于:(1)为定位一个查询关系,主体与客体均需被时空定位;(2)视频中视觉关系的时间动态特性难以捕捉;(3)定位应在无任何时空直接监督下完成。为定位关系,我们通过关系关注与重构,在构建的层次化时空区域图上协同优化两条区域序列来应对挑战,并进一步提出一种通过视觉实体间空间注意力偏移的消息传递机制。实验结果表明,我们的模型不仅能显著优于基线方法,还能生成具有视觉意义的事实以支撑视觉定位。(代码见 https://github.com/doc-doc/vRGV)
引用
@article{arxiv.2007.08814,
title = {Visual Relation Grounding in Videos},
author = {Junbin Xiao and Xindi Shang and Xun Yang and Sheng Tang and Tat-Seng Chua},
journal= {arXiv preprint arXiv:2007.08814},
year = {2020}
}
备注
ECCV2020 (spotlight)