中文

使用1%计算学习零样本主体驱动视频生成

计算机视觉与模式识别 2026-05-06 v3 图像与视频处理

摘要

主体驱动视频生成(SDV-Gen)旨在通过适配预训练视频模型来生成特定主体的视频,实现个人化和应用驱动的内容创建。为实现这一目标,per-subject tuning方法需要约200个A100 GPU小时才能生成定制视频,而零样本方法则避免了subject-specific tuning,但通常依赖数百万主体-视频对进行监督,导致巨大的网络fine-tuning成本(10K-200K A100 GPU小时)。我们提出了一个数据和计算效率的零样本SDV-Gen框架,既避免test-time per-subject tuning,又不使用大规模主体-视频对。我们的关键思想是将SDV-Gen分解为(i)从主体图像对中学习的identity injection,以及(ii)通过小套任意视频维持的motion-awareness preservation。我们使用随机reference-frame sampling和image-token dropout来防止平凡的第一帧复制。我们的gradient analysis显示,这两个目标快速地演化到接近正交的update子空间,这解释了稳定的优化。使用CogVideoX-5B,我们在200K主体图像对和4,000个任意视频中仅用288个A100 GPU小时即可适配单个模型。这相当于以前的零样本基线的约1%(即0.4%的VACE和2.8%的Phantom),且不使用主体-视频对,仍在主体忠实性和motion quality方面保持竞争力。我们表明,相同的配方也适用于Wan 2.2-5B。

关键词

引用

@article{arxiv.2504.17816,
  title  = {Learning Zero-Shot Subject-Driven Video Generation Using 1% Compute},
  author = {Daneul Kim and Jingxu Zhang and Wonjoon Jin and Sunghyun Cho and Qi Dai and Jaesik Park and Chong Luo},
  journal= {arXiv preprint arXiv:2504.17816},
  year   = {2026}
}

备注

[v3 updated] Project Page : https://carpedkm.github.io/projects/disentangled_sub/index.html