中文

让梦想成为现实:持续文本到视频定制化

计算机视觉与模式识别 2025-12-11 v2

摘要

定制化文本到视频生成(CTVG)最近在生成来自用户特定文本的量身定制视频方面取得了显著进展。然而,大多数 CTVG 方法假设个性化概念保持静态,不会随时间逐步扩展。此外,它们在持续学习新概念(包括主体和动作)时难以处理遗忘和概念忽视问题。为解决上述挑战,我们开发了一种新的持续定制视频扩散模型(CCVD),该模型能够通过解决遗忘和概念忽视问题来持续学习新概念,以完成各种文本到视频生成任务。为解决灾难性遗忘问题,我们引入了概念特定属性保留模块和任务感知概念聚合策略。它们可以在训练期间捕捉旧概念的独特特征和身份,在测试期间根据其相关性将所有旧概念的主体和动作适配器组合在一起。此外,为解决概念忽视问题,我们开发了可控条件合成,以增强区域特征并将视频语境与用户条件对齐,通过纳入基于图层特定区域注意力引导的噪声估计。大量实验比较表明,我们的 CCVD 在 DreamVideo 和 Wan 2.1 两个 backbone 上均优于现有的 CTVG 基线方法。代码已公开于 https://github.com/JiahuaDong/CCVD。

关键词

引用

@article{arxiv.2512.05802,
  title  = {Bring Your Dreams to Life: Continual Text-to-Video Customization},
  author = {Jiahua Dong and Xudong Wang and Wenqi Liang and Zongyan Han and Meng Cao and Duzhen Zhang and Hanbin Zhao and Zhi Han and Salman Khan and Fahad Shahbaz Khan},
  journal= {arXiv preprint arXiv:2512.05802},
  year   = {2025}
}

备注

Accepted to AAAI2026