教学视频中的无监督视觉-语言指代消解
计算机视觉与模式识别
2017-05-23 v2
摘要
我们提出了一种用于教学视频中指代消解的无监督方法,其目标是将实体(例如“调味汁”)在时间上链接到产生它的动作(例如“混合酸奶”)。关键挑战在于实体在视频中视觉外观和指代表达的变化所导致的不可避免的视觉-语言歧义。由于我们旨在无监督地消解指代,这一挑战被进一步放大。我们通过学习一个联合视觉-语言模型来应对这些挑战,其中语言线索可以帮助消除视觉歧义,反之亦然。我们利用来自 YouTube 的两千多个非结构化烹饪视频无监督地训练模型来验证我们的方法,并表明我们的视觉-语言模型在教学视频指代消解任务上能显著优于最先进的纯语言模型。
引用
@article{arxiv.1703.02521,
title = {Unsupervised Visual-Linguistic Reference Resolution in Instructional Videos},
author = {De-An Huang and Joseph J. Lim and Li Fei-Fei and Juan Carlos Niebles},
journal= {arXiv preprint arXiv:1703.02521},
year = {2017}
}
备注
CVPR 2017