中文

跟随显著性:基于显著性的检索增强密集视频描述

计算机视觉与模式识别 2026-03-16 v2

摘要

现有的检索增强方法用于密集视频描述(Dense Video Captioning,简称 DVC)往往难以实现与真实事件边界一致的准确时间分段,因为它们依赖经验策略而忽视真实事件边界。提出的框架 STaRC 通过高亮检测模块对帧级显著性进行监督,克服了这一限制。注意,高亮检测模块是在直接从 DVC ground truth 标注派生的二进制标签上训练的,不需要额外的标注。我们还提出利用显著性得分作为统一的时间信号,通过显著性引导分段驱动检索,并通过注入解码器中的显著性提示(Saliency Prompts)来指导描述生成。通过强制显著性约束分段,我们的方法产生与实际事件转换一致的时序连贯分段,从而实现更准确的检索和更具语境的描述生成。我们在 YouCook2 和 ViTT 数据集上进行了全面评估,STaRC 在大多数指标上实现了最先进的性能。我们的代码可在 https://github.com/ermitaju1/STaRC 获取。

关键词

引用

@article{arxiv.2603.11460,
  title  = {Follow the Saliency: Supervised Saliency for Retrieval-augmented Dense Video Captioning},
  author = {Seung hee Choi and MinJu Jeon and Hyunwoo Oh and Jihwan Lee and Dong-Jin Kim},
  journal= {arXiv preprint arXiv:2603.11460},
  year   = {2026}
}

备注

CVPR 2026 accepted paper (main track)