中文

UniVTG:面向统一的视频-语言时间定位

计算机视觉与模式识别 2023-08-21 v2

摘要

视频时间定位(VTG)旨在根据自定义语言查询(如句子或词)从视频中定位目标片段(如连续区间或不相交镜头),是社交媒体视频浏览的关键。该方向多数方法开发任务专用模型,并以类型特定标签(如时刻检索(时间区间)与高亮检测(价值曲线))训练,限制了其泛化至各类 VTG 任务与标签的能力。本文提出统一多样 VTG 标签与任务,称为 UniVTG,沿三个方向:首先,我们重访广泛 VTG 标签与任务并定义统一表述。基于此,我们开发数据标注方案以创建可扩展伪监督。其次,我们开发高效且灵活的定位模型,能处理各任务并充分利用各标签。最后,得益于统一框架,我们得以从大规模多样标签解锁时间定位预训练并发展更强定位能力,如零样本定位。在三个任务(时刻检索、高亮检测与视频摘要)跨七个数据集(QVHighlights、Charades-STA、TACoS、Ego4D、YouTube Highlights、TVSum 与 QFVS)上的大量实验证明了我们框架的有效性与灵活性。代码见 https://github.com/showlab/UniVTG。

关键词

引用

@article{arxiv.2307.16715,
  title  = {UniVTG: Towards Unified Video-Language Temporal Grounding},
  author = {Kevin Qinghong Lin and Pengchuan Zhang and Joya Chen and Shraman Pramanick and Difei Gao and Alex Jinpeng Wang and Rui Yan and Mike Zheng Shou},
  journal= {arXiv preprint arXiv:2307.16715},
  year   = {2023}
}

备注

Accepted by ICCV 2023. 16 pages, 10 figures, 13 tables. Code: https://github.com/showlab/UniVTG