中文

更少即更好:可控文本到视频生成的数据高效适应

计算机视觉与模式识别 2026-04-09 v4 人工智能

摘要

针对添加新生成控制(如对物理相机参数的控制,如快门速度或光圈)进行大规模文本到视频扩散模型微调,通常需要难以获取的大量高保真数据集。本文提出一种数据高效微调策略,从稀疏、低质量合成数据中学习这些控制。我们表明,仅凭简单数据进行微调即可实现所需控制,甚至能产生优于在照片级"真实"数据上微调的模型。除展示这些结果外,我们提供一个框架,既直观又定量地解释了这一现象。

关键词

引用

@article{arxiv.2511.17844,
  title  = {Less is More: Data-Efficient Adaptation for Controllable Text-to-Video Generation},
  author = {Shihan Cheng and Nilesh Kulkarni and David Hyde and Dmitriy Smirnov},
  journal= {arXiv preprint arXiv:2511.17844},
  year   = {2026}
}