AnimeShooter:面向参考引导视频生成的多镜头动画数据集
计算机视觉与模式识别
2025-06-04 v1
摘要
人工智能生成内容(AIGC)的最新进展显著加速了动画制作。为了制作引人入胜的动画,生成具有叙事脚本和角色参考的连贯多镜头视频片段至关重要。然而,现有的公开数据集主要关注具有全局描述的真实世界场景,并且缺乏用于一致角色引导的参考图像。为了弥合这一差距,我们提出了 AnimeShooter,一个参考引导的多镜头动画数据集。AnimeShooter 通过自动化流程具有全面的分层标注和跨镜头的强视觉一致性。故事级标注提供叙事概述,包括故事情节、关键场景以及带有参考图像的主要角色档案;而镜头级标注将故事分解为连续的镜头,每个镜头均标注有场景、角色以及叙事和描述性视觉字幕。此外,专用子集 AnimeShooter-audio 为每个镜头提供同步的音轨,以及音频描述和声源。为了证明 AnimeShooter 的有效性并为参考引导的多镜头视频生成任务建立基线,我们引入了 AnimeShooterGen,它利用多模态大语言模型(MLLM)和视频扩散模型。参考图像和先前生成的镜头首先由 MLLM 处理,以产生同时感知参考和上下文的表示,随后将其作为扩散模型的条件以解码后续镜头。实验结果表明,在 AnimeShooter 上训练的模型实现了卓越的跨镜头视觉一致性以及对参考视觉引导的遵循,这突显了我们的数据集在连贯动画视频生成方面的价值。
引用
@article{arxiv.2506.03126,
title = {AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation},
author = {Lu Qiu and Yizhuo Li and Yuying Ge and Yixiao Ge and Ying Shan and Xihui Liu},
journal= {arXiv preprint arXiv:2506.03126},
year = {2025}
}
备注
Project released at: https://qiulu66.github.io/animeshooter/