DORi:为视频中自然语言查询的时刻定位发掘物体关系
计算机视觉与模式识别
2020-10-14 v1
摘要
本文研究利用自然语言查询在长未剪辑视频中进行时间时刻定位的任务。给定查询句,目标是在视频中确定相关片段的起止。我们的关键创新在于通过一种适用于时间时刻定位的语言条件消息传递算法来学习视频特征嵌入,该算法捕捉视频中人物、物体与活动之间的关系。这些关系由一个空间子图获得,该子图利用检测到的物体与以语言查询为条件的人体特征对场景表示进行语境化。此外,一个时间子图通过时间捕捉视频中的活动。我们的方法在三个标准基准数据集上进行了评估,并引入 YouCookII 作为该任务的新基准。实验表明我们的方法在这些数据集上优于 SOTA 方法,证实了方法的有效性。
引用
@article{arxiv.2010.06260,
title = {DORi: Discovering Object Relationship for Moment Localization of a Natural-Language Query in Video},
author = {Cristian Rodriguez-Opazo and Edison Marrese-Taylor and Basura Fernando and Hongdong Li and Stephen Gould},
journal= {arXiv preprint arXiv:2010.06260},
year = {2020}
}