中文

VideoMage:文本到视频扩散模型多主体及运动定制化

计算机视觉与模式识别 2025-03-28 v1

摘要

定制化文本到视频生成旨在生成包含用户指定主体身份或运动模式的高质量视频。然而,现有方法主要聚焦于个人化单个概念,要么是主体身份,要么是运动模式,限制了其针对多个具有所需运动模式的主体的有效性。为解决这一挑战,我们提出一种统一框架 VideoMage,用于视频定制化,同时处理多个主体及其相互运动。VideoMage 使用主体和运动 LoRAs 从用户提供的图像和视频中捕获个人化内容,同时采用无外观依赖的运动学习方法以 disentangle 运动模式与视觉外观。此外,我们开发了时空组合方案以引导主体在所需运动模式内的相互作用。广泛的实验表明,VideoMage 优于现有方法,生成连贯且可由用户控制的视频,主体身份和相互作用保持一致。

关键词

引用

@article{arxiv.2503.21781,
  title  = {VideoMage: Multi-Subject and Motion Customization of Text-to-Video Diffusion Models},
  author = {Chi-Pin Huang and Yen-Siang Wu and Hung-Kai Chung and Kai-Po Chang and Fu-En Yang and Yu-Chiang Frank Wang},
  journal= {arXiv preprint arXiv:2503.21781},
  year   = {2025}
}

备注

CVPR 2025. Project Page: https://jasper0314-huang.github.io/videomage-customization