FairyGen:从单个儿童手绘人物生成叙事化卡通视频
图形学
2025-06-30 v2 计算机视觉与模式识别
多媒体
摘要
我们提出了FairyGen,一个自动系统,用于从单个儿童的绘画生成以故事为导向的卡通视频,同时忠实地保留其独特的艺术风格。与之前的叙事方法不同,FairyGen显式地将角色建模与风格化背景生成分离,并包含电影镜头设计以支持具有表现力和连贯性的叙事。给定一个角色草图,我们首先采用大语言模型(MLLM)生成具有镜头级别描述的结构化分镜,指定环境设置、角色动作和摄影视角。为确保视觉一致性,我们引入了风格传播适配器来捕获角色的视觉风格并将其应用于背景,忠实地保留角色的完整视觉身份,同时合成风格一致的场景。镜头设计模块通过基于分镜的框选和多视角合成进一步增强视觉多样性和电影质量。为对故事进行动画化,我们重建角色的3D代理以派生物理上合理的运动序列,这些序列随后用于微调基于MMDiT的图像到视频扩散模型。我们进一步提出了一个两阶段运动自定义适配器:第一个阶段从时序无序帧中学习外观特征,分离身份与运动;第二个阶段采用冻结身份权重的时序偏移策略来建模时间动态。一旦训练完成,FairyGen即可直接渲染与分镜一致的多样且连贯的视频场景。广泛的实验表明,我们的系统产生的动画在风格忠实、叙事结构自然运动方面表现优异,凸显了其用于个性化和引人入目故事动画的潜力。代码将在https://github.com/GVCLab/FairyGen上提供。
引用
@article{arxiv.2506.21272,
title = {FairyGen: Storied Cartoon Video from a Single Child-Drawn Character},
author = {Jiayi Zheng and Xiaodong Cun},
journal= {arXiv preprint arXiv:2506.21272},
year = {2025}
}
备注
Project Page: https://jayleejia.github.io/FairyGen/ ; Code: https://github.com/GVCLab/FairyGen