中文

预训练图文模型实为隐式视频描述器

计算机视觉与模式识别 2025-02-20 v1 机器学习

摘要

开发视频描述模型在计算上代价高昂。视频的动态特性也增加了能够有效描述这些序列的多模态模型的设计难度。然而,我们发现,通过使用最少的计算资源且无需进行复杂修改以应对视频动态,即可将基于图像的模型改造为优于多个专用视频描述系统的模型。我们改造后的模型在主要基准测试中表现出顶尖性能,在 MSRVTT 和 MSVD 上排名第 2,在 VATEX 上排名第 3。我们仅使用 6,000 个视频文本对并简单拼接帧(相比其他方法使用 250 万至 1.44 亿对数据,数据量显著减少),对典型图像描述模型 BLIP2 进行后训练,将其转化为具有竞争力的视频描述器。从资源优化的角度,本研究聚焦于三个基本因素:优化模型规模、最大化数据效率以及引入强化学习。这项广泛的研究表明,轻量级的基于图像的适配策略可媲美 SOTA 视频描述系统,为低资源场景提供了实用解决方案。

关键词

引用

@article{arxiv.2502.13363,
  title  = {Pretrained Image-Text Models are Secretly Video Captioners},
  author = {Chunhui Zhang and Yiren Jian and Zhongyu Ouyang and Soroush Vosoughi},
  journal= {arXiv preprint arXiv:2502.13363},
  year   = {2025}
}

备注

Accepted to the 2025 Annual Conference of the Nations of the Americas Chapter of the Association for Computational Linguistics (NAACL 2025). The first two authors contributed equally and were listed in random order