DualReal:面向视频定制中无损身份-运动融合的自适应联合训练
计算机视觉与模式识别
2025-07-22 v2 人工智能
摘要
基于预训练大规模模型的定制化文本到视频生成,因关注身份和运动一致性而近期备受瞩目。现有工作通常遵循孤立的定制范式,即单独定制主体身份或运动动态。然而,这种范式完全忽略了身份与运动之间内在的相互约束和协同依赖关系,导致在整个生成过程中出现身份-运动冲突,从而系统性地降低生成质量。为解决此问题,我们提出了DualReal,一个新颖的框架,它采用自适应联合训练来协同构建维度间的相互依赖关系。具体而言,DualReal由两个单元组成:(1) 双重感知自适应(Dual-aware Adaptation)动态切换训练步骤(即身份或运动),在冻结维度先验的引导下学习当前信息,并采用正则化策略防止知识泄漏;(2) 阶段混合控制器(StageBlender Controller)利用去噪阶段和扩散Transformer深度,以自适应粒度引导不同维度,避免各阶段的冲突,最终实现身份和运动模式的无损融合。我们构建了一个比现有方法更全面的评估基准。实验结果表明,DualReal将CLIP-I和DINO-I指标平均提高了21.7%和31.8%,并在几乎所有运动指标上达到了顶尖性能。项目页面:https://wenc-k.github.io/dualreal-customization
引用
@article{arxiv.2505.02192,
title = {DualReal: Adaptive Joint Training for Lossless Identity-Motion Fusion in Video Customization},
author = {Wenchuan Wang and Mengqi Huang and Yijing Tu and Zhendong Mao},
journal= {arXiv preprint arXiv:2505.02192},
year = {2025}
}
备注
Accepted by ICCV2025