WSLLN:弱监督自然语言定位网络
计算机视觉与模式识别
2019-09-04 v1
摘要
我们提出弱监督语言定位网络(WSLLN)以在给定语言查询的长未剪辑视频中检测事件。为了学习视觉片段与文本之间的对应关系,以往大多数方法需要事件的时间坐标(起始与结束时间)用于训练,这导致高昂的标注成本。WSLLN 仅使用视频-句子对进行训练,无需访问事件的时间位置,从而减轻了标注负担。凭借简单的端到端结构,WSLLN 同时衡量片段-文本一致性并进行片段选择(以文本为条件)。两者的结果被融合并作为一个视频-句子匹配问题进行优化。在 ActivityNet Captions 和 DiDeMo 上的实验表明,WSLLN 达到了最先进的性能。
引用
@article{arxiv.1909.00239,
title = {WSLLN: Weakly Supervised Natural Language Localization Networks},
author = {Mingfei Gao and Larry S. Davis and Richard Socher and Caiming Xiong},
journal= {arXiv preprint arXiv:1909.00239},
year = {2019}
}
备注
accepted by EMNLP2019