中文

基于损失加权与对象交互的弱监督文本视频对象定位

计算机视觉与模式识别 2018-07-23 v2

摘要

我们研究弱监督视频对象定位:给定一个视频片段及对应的描述性句子,目标是在视频中定位句子里提及的对象。训练时无可用的对象边界框,但待定位的可能对象集合是预先已知的。图像领域的现有方法使用多示例学习(MIL)通过强化视觉与语义特征之间的匹配来定位对象。将该方法朴素地扩展到视频领域是把整个片段视为空间对象提议的包。然而,跨多帧稀疏出现的对象可能无法被完整检测到,因为从单帧成功发现它就会触发一个满意的匹配。为此,我们将弱监督信号从片段级别传播到可能包含目标对象的帧。对于不太可能包含目标对象的帧,我们使用一种替代的惩罚损失。我们还利用对象之间的交互作为定位的文本引导。我们在新收集的基准 YouCook2-BoundingBox 上评估了我们的模型,并显示出相对于有竞争力的基线的改进。

关键词

引用

@article{arxiv.1805.02834,
  title  = {Weakly-Supervised Video Object Grounding from Text by Loss Weighting and Object Interaction},
  author = {Luowei Zhou and Nathan Louis and Jason J. Corso},
  journal= {arXiv preprint arXiv:1805.02834},
  year   = {2018}
}

备注

16 pages including Appendix