中文

恶魔藏在分布中:在零样本视频描述中显式建模场景内容是关键

计算机视觉与模式识别 2025-04-01 v1

摘要

零样本视频描述要求模型在没有人工标注的视频文本对进行训练的情况下生成高质量的描述。当前方法通常利用 CLIP 提取与视觉相关的文本提示,以引导语言模型生成描述。这些方法倾向于关注场景的一个关键方面,构建忽略其余视觉输入的描述。为此,我们提出一种 novel 的分级多粒度文本提示策略用于零样本视频描述。该方法构建三个不同的记忆库,涵盖名词短语、名词短语的场景图以及整个句子。此外,我们引入一种类别感知检索机制,建模特定主题周围自然语言的分布。大量实验表明,在 MSR-VTT、MSVD 和 VATEX 基准测试中,我们的方法相较于现有 SOTA 方法在主要指标 CIDEr 上分别提高了 5.7%、16.2% 和 3.4%。

关键词

引用

@article{arxiv.2503.23679,
  title  = {The Devil is in the Distributions: Explicit Modeling of Scene Content is Key in Zero-Shot Video Captioning},
  author = {Mingkai Tian and Guorong Li and Yuankai Qi and Amin Beheshti and Javen Qinfeng Shi and Anton van den Hengel and Qingming Huang},
  journal= {arXiv preprint arXiv:2503.23679},
  year   = {2025}
}

备注

13 pages