JointTuner:用于定制视频生成的外观-运动自适应联合训练
计算机视觉与模式识别
2025-11-25 v3
摘要
最近在定制视频生成方面的进展显著提升了外观和运动的同步适应。通常,分离进行外观和运动训练的先前方法会引入概念干扰,导致外观特征或运动模式的渲染不准确。此外,这些方法常常存在外观污染,即来自参考视频的背景和前景元素扭曲定制视频。本文提出了 JointTuner 以缓解这些问题。JointTuner 的核心动机是实现对外观和运动组件的联合优化,基于此开发了两项关键创新,即门控低秩适应(GLoRA)和外观独立时间损失(AiT Loss)。具体而言,GLoRA 使用基于上下文的激活层,类似于门控调节器,动态引导 LoRA 模块学习是外观还是运动,同时保持时空一致性。此外,基于发现通道-时间位移噪声抑制外观相关的低频并增强运动相关的高频,我们设计了 AiT Loss。该损失在微调期间为扩散模型预测的噪声添加相同的位移,迫使模型优先学习运动模式。JointTuner 的体系结构无关设计支持 UNet(如 ZeroScope)和扩散 Transformer(如 CogVideoX)作为主干,确保其定制能力随着基础视频模型的演进而扩展。进一步,我们提出了针对外观-运动组合定制的系统评估框架,覆盖 90 种组合,在四个关键维度上进行评估:语义对齐、运动动态性、时间一致性和感知质量。我们的项目主页已在线上开放。
引用
@article{arxiv.2503.23951,
title = {JointTuner: Appearance-Motion Adaptive Joint Training for Customized Video Generation},
author = {Fangda Chen and Shanshan Zhao and Chuanfu Xu and Long Lan},
journal= {arXiv preprint arXiv:2503.23951},
year = {2025}
}
备注
Project Page: https://fdchen24.github.io/JointTuner-Website