中文

SGCap:解码视频零样本captioning中的语义组

计算机视觉与模式识别 2025-08-05 v1

摘要

零样本视频captioning旨在无需训练视频文本对模型,生成描述视频的句子,这一领域尚未得到充分探索。现有零样本图像captioning方法通常采用仅文本训练范式,语言解码器重建来自CLIP获取的单句嵌入。但直接将其扩展到视频领域效果不佳,由于对所有帧进行平均池化忽略了时序动态。为此,我们提出一种语义组captioning(SGCap)方法用于零样本视频captioning。具体而言,它发展出语义组解码(SGD)策略,以多帧信息建模,显式建模帧间时序关系。此外,现有零样本captioning方法依赖余弦相似度进行句子检索,并由单个帧级caption监督重构描述,难以提供充足的视频级监督。为缓解此问题,我们引入两个关键组件,包括关键句子选择(KSS)模块和概率抽样监督(PSS)模块。这两个模块构建语义多样化的句子组,模型捕获时序动态,引导模型捕获句子间因果关系,从而增强其对视频captioning的泛化能力。实验结果表明,SGCap在多个基准上显著优于以前的零样本SOTA方法,甚至与全监督方法性能相当。代码可在https://github.com/mlvccn/SGCap_Video获取。

关键词

引用

@article{arxiv.2508.01270,
  title  = {SGCap: Decoding Semantic Group for Zero-shot Video Captioning},
  author = {Zeyu Pan and Ping Li and Wenxiao Wang},
  journal= {arXiv preprint arXiv:2508.01270},
  year   = {2025}
}

备注

11 pages, 9 figures, 11 tables