中文

EtC:基于多模态大语言模型的弱监督视频定位中的时序边界扩展与澄清

计算机视觉与模式识别 2024-03-07 v2

摘要

早期的弱监督视频定位(WSVG)方法由于缺乏时序边界标注,常常难以完整地检测边界。为了弥合视频级标注与边界级标注之间的差距,显式监督方法(即生成伪时序边界用于训练)取得了巨大成功。然而,这些方法中的数据增强可能会破坏关键的时序信息,从而产生较差的伪边界。在本文中,我们提出了一种新视角,即在保持原始时序内容完整性的同时,引入更有价值的信息以扩展不完整的边界。为此,我们提出了 EtC(先扩展后澄清),首先利用附加信息扩展初始的不完整伪边界,然后细化这些扩展后的边界以获得精确边界。受视频连续性(即相邻帧之间的视觉相似性)驱动,我们使用强大的多模态大语言模型(MLLM)对初始伪边界内的每一帧进行标注,从而为扩展边界生成更全面的描述。为了进一步澄清扩展边界中的噪声,我们将互学习与一种定制化的候选段级对比目标相结合,以可学习的方式在不完整但干净(初始)与全面但有噪声(扩展)边界之间取得平衡,从而获得更精确的边界。实验表明,我们的方法在两个具有挑战性的 WSVG 数据集上具有优越性。

关键词

引用

@article{arxiv.2312.02483,
  title  = {EtC: Temporal Boundary Expand then Clarify for Weakly Supervised Video Grounding with Multimodal Large Language Model},
  author = {Guozhang Li and Xinpeng Ding and De Cheng and Jie Li and Nannan Wang and Xinbo Gao},
  journal= {arXiv preprint arXiv:2312.02483},
  year   = {2024}
}