中文

基于扩散模型迭代精炼的视频定位探索

计算机视觉与模式识别 2024-01-01 v2

摘要

视频定位旨在未裁剪视频中定位与给定句子查询对应的目标片段。现有方法通常从一组预定义候选中选取最佳预测,或以单阶段方式直接回归目标区间,导致缺乏系统性的预测精炼过程。本文中,我们提出 DiffusionVG,一种利用扩散模型的新颖框架,将视频定位表述为条件生成任务,其中目标区间从高斯噪声输入生成并在反向扩散过程中迭代精炼。训练期间,DiffusionVG 通过固定的前向扩散过程逐步向目标区间加噪,并学习在反向扩散过程中恢复目标区间。推理时,DiffusionVG 可通过以视频-句子表示为条件的学习到的反向扩散过程从高斯噪声输入生成目标区间。无需额外技巧,我们的 DiffusionVG 在主流的 Charades-STA、ActivityNet Captions 和 TACoS 基准上相比现有精心设计的模型展现出更优性能。

关键词

引用

@article{arxiv.2310.17189,
  title  = {Exploring Iterative Refinement with Diffusion Models for Video Grounding},
  author = {Xiao Liang and Tao Shi and Yaoyuan Liang and Te Tao and Shao-Lun Huang},
  journal= {arXiv preprint arXiv:2310.17189},
  year   = {2024}
}