中文

基于检索增强的零样图视频字幕 (RETTA)

计算机视觉与模式识别 2025-10-29 v3

摘要

尽管完全监督的视频字幕取得了显著进展,但零样图方法仍被严重低估。在本文中,我们提出了一种名为检索增强测试时适应 (Retrieval-Enhanced Test-Time Adaptation, RETTA) 的新型零零样图视频字幕框架,该框架利用现有的预训练大规模视觉和语言模型直接生成带有测试时适应的字幕。具体而言,我们使用四个关键模型桥接视频和文本:通用视频文本检索模型 XCLIP、通用图像文本匹配模型 CLIP、文本对齐模型 AnglE 和文本生成模型 GPT-2,由于其源代码可用性。主要挑战在于如何使文本生成模型足够了解给定视频的内容,以生成相应的字幕。为解决此问题,我们提出使用可学习标记作为这些四个冻结模型 GPT-2、XCLIP、CLIP 和 AnglE 之间的通信媒介。不同于常规方法使用训练数据训练这些标记,我们提出在几个精心设计的损失函数下,针对推理数据的软目标学习这些标记,从而使标记吸收针对 GPT-2 的视频信息。该过程仅需数次迭代(实验中使用 16 次迭代)即可高效完成,且无需 ground truth 数据。广泛的实验结果在三个广泛使用的数据集 MSR-VTT、MSVD 和 VATEX 上显示,相较于几个最先进的零零样图视频字幕方法,CIDEr 指标提升了绝对 5.1%-32.4%。

关键词

引用

@article{arxiv.2405.07046,
  title  = {RETTA: Retrieval-Enhanced Test-Time Adaptation for Zero-Shot Video Captioning},
  author = {Yunchuan Ma and Laiyun Qing and Guorong Li and Yuankai Qi and Amin Beheshti and Quan Z. Sheng and Qingming Huang},
  journal= {arXiv preprint arXiv:2405.07046},
  year   = {2025}
}

备注

Published in Pattern Recognition