基于相似感知引导和跨标题增强学习的弱监督密集视频字幕方法 SAIL
计算机视觉与模式识别
2026-03-10 v2 人工智能
摘要
弱监督密集视频字幕旨在仅使用字幕注释训练视频,无需时间边界,对视频中的事件进行局部分析和描述。先前工作引入了基于高斯掩码和互补字幕的隐式监督范例。然而,现有方法仅关注生成非重叠掩码,未考虑其与相应事件之间的语义关系,导致生成简洁、均匀分布的掩码,无法捕获语义上有意义的区域。此外,仅依赖真实字幕会导致性能次优,这源于现有数据集的内在稀疏性。在本 work 中,我们提出了 SAIL,通过跨模态对齐构建语义感知掩码。我们的相似感知训练目标引导掩码强调与其相应事件字幕高度相似的视频区域。此外,为了在稀疏注释设置下实现更准确的掩码生成,我们引入基于 LLM 的增强策略生成合成字幕,以提供额外的对齐信号。这些合成字幕通过跨掩码机制整合,为精确的时间局部化提供辅助引导,而不会损害主目标。在 ActivityNet Captions 和 YouCook2 数据集上的实验表明,我们的方法在字幕和局部分析指标上均实现了最新的性能。
引用
@article{arxiv.2603.05437,
title = {SAIL: Similarity-Aware Guidance and Inter-Caption Augmentation-based Learning for Weakly-Supervised Dense Video Captioning},
author = {Ye-Chan Kim and SeungJu Cha and Si-Woo Kim and Minju Jeon and Hyungee Kim and Dong-Jin Kim},
journal= {arXiv preprint arXiv:2603.05437},
year = {2026}
}
备注
Accepted to CVPR 2026