用于未剪辑视频中自然语言弱监督时间定位的强化学习
计算机视觉与模式识别
2020-09-21 v1
摘要
未剪辑视频中自然语言的时间定位是一项基础且具有挑战性的多媒体任务,可促进跨媒体视觉内容检索。我们关注该任务的弱监督设定,即仅能获取粗粒度的视频级语言描述标注而无时间边界,这更符合现实,因为此类弱标注在实践中更易获得。本文提出一种边界自适应细化(BAR)框架,借助强化学习(RL)引导逐步细化时间边界的过程。据我们所知,我们首次尝试将 RL 扩展到带弱监督的时间定位任务。由于在缺乏成对细粒度边界-查询标注时直接获得奖励函数并非易事,我们设计了一个跨模态对齐评估器来衡量片段-查询对的对齐程度以提供量身定制的奖励。该细化方案完全摒弃了传统的基于滑动窗口的解决方案模式,有助于获得更高效、边界灵活且内容感知的定位结果。在 Charades-STA 和 ActivityNet 两个公开基准上的大量实验表明,BAR 优于 SOTA 弱监督方法,甚至击败了一些有竞争力的全监督方法。
引用
@article{arxiv.2009.08614,
title = {Reinforcement Learning for Weakly Supervised Temporal Grounding of Natural Language in Untrimmed Videos},
author = {Jie Wu and Guanbin Li and Xiaoguang Han and Liang Lin},
journal= {arXiv preprint arXiv:2009.08614},
year = {2020}
}
备注
Accepted by ACM MM 2020