AnyCharV:基于细到粗引导的自举可控角色视频生成
计算机视觉与模式识别
2025-05-22 v2
摘要
角色视频生成是一项重要的实际应用,旨在生成包含特定角色的高质量视频。近期的进展引入了各种控制信号来驱动静态角色的动画,成功增强了对生成过程的控制。然而,这些方法往往缺乏灵活性,限制了其适用性,使用户难以将源角色合成到期望的目标场景中。为解决这一问题,我们提出了一个新颖框架 AnyCharV,利用任意源角色和目标场景,在姿态引导下灵活生成角色视频。我们的方法涉及两阶段训练过程。第一阶段,我们开发了一个基础模型,能够利用姿态引导将源角色与目标场景集成。第二阶段通过自举机制进一步增强可控生成,我们使用第一阶段生成的视频,将精细掩码替换为粗粒度掩码,从而实现更好地保留角色细节的训练结果。广泛的实验结果表明,我们的方法优于先前最先进的方法。
引用
@article{arxiv.2502.08189,
title = {AnyCharV: Bootstrap Controllable Character Video Generation with Fine-to-Coarse Guidance},
author = {Zhao Wang and Hao Wen and Lingting Zhu and Chenming Shang and Yujiu Yang and Qi Dou},
journal= {arXiv preprint arXiv:2502.08189},
year = {2025}
}
备注
18 pages, 10 figures, 4 tables