中文

MagicAnime:面向卡通动画生成的层次化标注、多模态与多任务数据集与基准

计算机视觉与模式识别 2025-07-29 v1 多媒体

摘要

生成高质量的卡通动画多模态控制因非人类角色、风格化运动和细粒度情绪的复杂性而具有挑战性。卡通动画通常抽象且运动夸张,与真实世界视频之间存在巨大的领域差距。此外,由于大规模自动标注过程与真实场景相比极其稀缺,公开的多模态卡通数据几乎不存在。为弥合这一差距,我们提出了MagicAnime数据集,一个大规模、层次化标注、多模态数据集,旨在支持多个视频生成任务,以及随之包含的基准测试。该数据集包含40万个视频剪辑用于图像到视频生成,5万对视频剪辑和关键点用于全身标注,1.2万对视频剪辑用于视频到视频面部动画,2900对视频和音频剪辑用于音频驱动面部动画。同时,我们还构建了一套多模态卡通动画基准,称为MagicAnime-Bench,用于支持不同方法在上述任务中的比较。对四项任务进行的全面实验,包括视频驱动面部动画、音频驱动面部动画、图像到视频动画和姿态驱动角色动画,验证了其在支持高保真、细粒度和可控生成方面的有效性。

关键词

引用

@article{arxiv.2507.20368,
  title  = {MagicAnime: A Hierarchically Annotated, Multimodal and Multitasking Dataset with Benchmarks for Cartoon Animation Generation},
  author = {Shuolin Xu and Bingyuan Wang and Zeyu Cai and Fangteng Fu and Yue Ma and Tongyi Lee and Hongchuan Yu and Zeyu Wang},
  journal= {arXiv preprint arXiv:2507.20368},
  year   = {2025}
}

备注

8 pages,6 figures