中文

MomentDiff:从随机到真实的生成式视频时刻检索

计算机视觉与模式识别 2023-10-12 v2

摘要

视频时刻检索旨在提供一种高效且通用的解决方案,以在未剪辑视频中识别与给定语言描述相对应的特定时间片段。为实现这一目标,我们提供了一种名为 MomentDiff 的基于扩散的生成式框架,其模拟了人类从随机浏览到逐步定位的典型检索过程。具体而言,我们首先将真实跨度扩散为随机噪声,并学习在文本与视频相似度引导下将随机噪声去噪还原为原始跨度。这使模型能够学习从任意随机位置到真实时刻的映射,具备从随机初始化定位片段的能力。一旦训练完成,MomentDiff 可采样随机时间片段作为初始猜测,并迭代优化以生成准确的时间边界。与判别式工作(例如基于可学习提议或查询)不同,采用随机初始化跨度的 MomentDiff 能够抵抗来自数据集的时间位置偏差。为评估时间位置偏差的影响,我们提出了两个具有位置分布偏移的抗偏差数据集,名为 Charades-STA-Len 和 Charades-STA-Mom。实验结果表明,我们的高效框架在三个公开基准上持续优于最先进(state-of-the-art)方法,并在所提抗偏差数据集上展现出更好的泛化性和鲁棒性。代码、模型和抗偏差评估数据集可在 https://github.com/IMCCretrieval/MomentDiff 获取。

关键词

引用

@article{arxiv.2307.02869,
  title  = {MomentDiff: Generative Video Moment Retrieval from Random to Real},
  author = {Pandeng Li and Chen-Wei Xie and Hongtao Xie and Liming Zhao and Lei Zhang and Yun Zheng and Deli Zhao and Yongdong Zhang},
  journal= {arXiv preprint arXiv:2307.02869},
  year   = {2023}
}

备注

19 pages, 6 figures