中文

基于互补掩码的隐式位置-字幕对齐用于弱监督密集视频字幕生成

计算机视觉与模式识别 2025-01-28 v2 人工智能 多媒体

摘要

弱监督密集视频字幕生成(WSDVC)旨在无需事件边界标注的情况下,定位并描述视频中所有感兴趣的事件。由于缺乏相关监督,这一设定在准确定位事件的时间位置方面提出了巨大挑战。现有方法依赖于事件位置与字幕之间的显式对齐约束,这在训练和推理过程中都涉及复杂的事件提案程序。为了解决这个问题,我们提出了一种基于互补掩码的隐式位置-字幕对齐范式,该范式简化了复杂的事件提案和定位过程,同时保持了有效性。具体而言,我们的模型包含两个组件:双模式视频字幕生成模块和掩码生成模块。双模式视频字幕生成模块捕获全局事件信息并生成描述性字幕,而掩码生成模块生成可微的正负掩码用于定位事件。这些掩码通过确保从正负掩码视频生成的字幕是互补的,从而形成完整的视频描述,实现了事件位置和字幕的隐式对齐。通过这种方式,即使在弱监督下,事件位置和事件字幕也能被隐式地对齐。在公开数据集上的大量实验表明,我们的方法优于现有的弱监督方法,并与全监督方法取得了具有竞争力的结果。

关键词

引用

@article{arxiv.2412.12791,
  title  = {Implicit Location-Caption Alignment via Complementary Masking for Weakly-Supervised Dense Video Captioning},
  author = {Shiping Ge and Qiang Chen and Zhiwei Jiang and Yafeng Yin and Liu Qin and Ziyao Chen and Qing Gu},
  journal= {arXiv preprint arXiv:2412.12791},
  year   = {2025}
}

备注

Accepted by AAAI 2025