中文

WSLLN:弱监督自然语言定位网络

计算机视觉与模式识别 2019-09-04 v1

摘要

我们提出弱监督语言定位网络(WSLLN)以在给定语言查询的长未剪辑视频中检测事件。为了学习视觉片段与文本之间的对应关系,以往大多数方法需要事件的时间坐标(起始与结束时间)用于训练,这导致高昂的标注成本。WSLLN 仅使用视频-句子对进行训练,无需访问事件的时间位置,从而减轻了标注负担。凭借简单的端到端结构,WSLLN 同时衡量片段-文本一致性并进行片段选择(以文本为条件)。两者的结果被融合并作为一个视频-句子匹配问题进行优化。在 ActivityNet Captions 和 DiDeMo 上的实验表明,WSLLN 达到了最先进的性能。

关键词

引用

@article{arxiv.1909.00239,
  title  = {WSLLN: Weakly Supervised Natural Language Localization Networks},
  author = {Mingfei Gao and Larry S. Davis and Richard Socher and Caiming Xiong},
  journal= {arXiv preprint arXiv:1909.00239},
  year   = {2019}
}

备注

accepted by EMNLP2019