中文

基于语义补全网络的弱监督视频时刻检索

计算机视觉与模式识别 2020-01-16 v3 机器学习 多媒体

摘要

视频时刻检索旨在搜索与给定自然语言查询最相关的时刻。现有方法多在全监督设定下训练,需要每个查询的时间边界完整标注。然而,人工标注实际耗时且昂贵。本文提出一种新颖的弱监督时刻检索框架,训练仅需粗粒度视频级标注。具体而言,我们设计了一个候选生成模块,聚合上下文信息以单次前向过程生成并评分所有候选提案。随后我们设计了一种兼顾利用与探索的算法以选取 top-K 提案。接下来,我们构建语义补全模块来衡量所选提案与查询间的语义相似度,计算奖励并向候选生成模块提供反馈以优化评分。在 ActivityCaptions 和 Charades-STA 上的实验证明了所提方法的有效性。

关键词

引用

@article{arxiv.1911.08199,
  title  = {Weakly-Supervised Video Moment Retrieval via Semantic Completion Network},
  author = {Zhijie Lin and Zhou Zhao and Zhu Zhang and Qi Wang and Huasheng Liu},
  journal= {arXiv preprint arXiv:1911.08199},
  year   = {2020}
}

备注

Accepted by AAAI 2020 as a full paper