VC4VG:面向文本到视频生成优化的视频字幕
计算机视觉与模式识别
2025-10-31 v2 人工智能
计算与语言
摘要
文本到视频(T2V)生成的最新进展凸显了高质量视频-文本对在训练能够生成连贯且与指令对齐的视频的模型中的关键作用。然而,专门为T2V训练优化视频字幕的策略仍未得到充分探索。在本文中,我们介绍了VC4VG(面向视频生成的视频字幕),这是一个专为T2V模型需求量身定制的综合字幕优化框架。我们首先从T2V的角度分析字幕内容,将视频重建所需的基本元素分解为多个维度,并提出一种原则性的字幕设计方法。为了支持评估,我们构建了VC4VG-Bench,这是一个新的基准测试,具有与T2V特定需求对齐的细粒度、多维度和必要性分级的指标。广泛的T2V微调实验表明,改进的字幕质量与视频生成性能之间存在强相关性,验证了我们方法的有效性。我们在 https://github.com/alimama-creative/VC4VG 发布了所有基准测试工具和代码,以支持进一步的研究。
引用
@article{arxiv.2510.24134,
title = {VC4VG: Optimizing Video Captions for Text-to-Video Generation},
author = {Yang Du and Zhuoran Lin and Kaiqiang Song and Biao Wang and Zhicheng Zheng and Tiezheng Ge and Bo Zheng and Qin Jin},
journal= {arXiv preprint arXiv:2510.24134},
year = {2025}
}
备注
Accepted by EMNLP 2025