中文

用于自然语言视频定位的多尺度二维时序图扩散模型

计算机视觉与模式识别 2024-01-17 v1

摘要

自然语言视频定位(NLVL)旨在将自然语言描述中的短语对应到相应的视频片段,是视频理解中一项复杂但关键的任务。尽管不断取得进展,许多现有解决方案缺乏全局捕捉视频数据时序动态的能力。在本研究中,我们提出一种新颖的NLVL方法以解决此问题。我们的方法基于输入视频和语言查询,通过条件去噪扩散过程直接生成全局二维时序图。主要挑战在于设计扩散解码器时二维时序图固有的稀疏性和不连续性。为应对这些挑战,我们引入多尺度技术并开发了一种创新的扩散解码器。我们的方法有效封装了查询与视频数据在不同时间尺度上的交互。在Charades和DiDeMo数据集上的实验证明了我们设计的有效性。

关键词

引用

@article{arxiv.2401.08232,
  title  = {Multi-scale 2D Temporal Map Diffusion Models for Natural Language Video Localization},
  author = {Chongzhi Zhang and Mingyuan Zhang and Zhiyang Teng and Jiayi Li and Xizhou Zhu and Lewei Lu and Ziwei Liu and Aixin Sun},
  journal= {arXiv preprint arXiv:2401.08232},
  year   = {2024}
}