中文

Any2Caption:将任意条件解释为字幕以用于可控视频生成

计算机视觉与模式识别 2025-12-15 v2 人工智能

摘要

为了解决当前视频生成社区中准确用户意图解释的瓶颈,我们提出了 Any2Caption,一个在任意条件下进行可控视频生成的新颖框架。关键思想是将各种条件解释步骤与视频合成步骤解耦。通过利用现代多模态大型语言模型 (MLLM),Any2Caption 将多种输入——文本、图像、视频以及诸如区域、运动和相机姿态等专业线索——解释为密集的结构化字幕,从而为主干视频生成器提供更好的指导。我们还引入了 Any2CapIns,一个包含 337K 个实例和 407K 个条件的大规模数据集,用于任意条件到字幕的指令微调。综合评估表明,我们的系统在现有视频生成模型的各种方面的可控性和视频质量上均有显著提升。项目页面:https://sqwu.top/Any2Cap/

关键词

引用

@article{arxiv.2503.24379,
  title  = {Any2Caption:Interpreting Any Condition to Caption for Controllable Video Generation},
  author = {Shengqiong Wu and Weicai Ye and Jiahao Wang and Quande Liu and Xintao Wang and Pengfei Wan and Di Zhang and Kun Gai and Shuicheng Yan and Hao Fei and Tat-Seng Chua},
  journal= {arXiv preprint arXiv:2503.24379},
  year   = {2025}
}

备注

Project Page: https://sqwu.top/Any2Cap/