中文

ConceptMaster:无需测试时微调的多概念视频定制扩散 Transformer 模型

计算机视觉与模式识别 2025-05-14 v2

摘要

文本到视频生成通过扩散模型取得了显著进展。然而,多概念视频定制(MCVC)仍是重大挑战。我们确定该任务的两个关键挑战:1)身份解耦问题,即直接采用现有定制方法处理多个概念时不可避免地混合身份属性;2)高质量视频实体对的稀缺,这对于能够很好地表示和解耦各种定制概念的训练模型至关重要。为解决这些挑战,我们引入 ConceptMaster,一种新颖框架有效解决身份解耦问题,同时在视频定制中保持概念忠实。具体而言,我们提出学习解耦的多概念嵌入并以独立方式注入扩散模型,这有效保证了包含多个身份、甚至高度相似视觉概念的定制视频质量。为克服高质量 MCVC 数据的稀缺,我们建立了数据构建管道,使能够收集跨 diverse 场景的高质量多概念视频实体数据对。进一步设计了多概念视频评估集,从概念忠实度、身份解耦能力和视频生成质量三个维度,覆盖六种不同的概念组合场景进行全面验证。广泛实验表明,ConceptMaster 在视频定制任务中显著优于先前方法,展现了为视频扩散模型生成个性化且语义准确内容的巨大潜力。

关键词

引用

@article{arxiv.2501.04698,
  title  = {ConceptMaster: Multi-Concept Video Customization on Diffusion Transformer Models Without Test-Time Tuning},
  author = {Yuzhou Huang and Ziyang Yuan and Quande Liu and Qiulin Wang and Xintao Wang and Ruimao Zhang and Pengfei Wan and Di Zhang and Kun Gai},
  journal= {arXiv preprint arXiv:2501.04698},
  year   = {2025}
}

备注

Project Page: https://yuzhou914.github.io/ConceptMaster/. Update and release MCVC Evaluation Set