零样本自然语言视频定位
计算与语言
2021-10-04 v1 人工智能
计算机视觉与模式识别
摘要
理解视频以用自然语言定位时刻通常需要大量昂贵的标注视频区域与语言查询配对。为消除标注成本,我们首次尝试以零样本方式训练自然语言视频定位模型。受无监督图像描述生成设置启发,我们仅需要随机文本语料、无标注视频集合以及现成的目标检测器来训练模型。利用未配对数据,我们提出生成候选时间区域与对应查询句子的伪监督,并开发一个简单的 NLVL 模型以该伪监督进行训练。我们的实证验证表明,所提伪监督方法在 Charades-STA 与 ActivityNet-Captions 上优于若干基线方法以及若干使用更强监督的方法。
引用
@article{arxiv.2110.00428,
title = {Zero-shot Natural Language Video Localization},
author = {Jinwoo Nam and Daechul Ahn and Dongyeop Kang and Seong Jong Ha and Jonghyun Choi},
journal= {arXiv preprint arXiv:2110.00428},
year = {2021}
}
备注
10 pages, 7 figures