Sakuga-42M 数据集:放大卡通动画研究
计算机视觉与模式识别
2024-05-24 v1
摘要
手绘卡通动画运用草图和平面配色片段来创造运动的错觉。虽然近期像 CLIP、SVD 和 Sora 等技术在大规模模型与数据集的支持下,展现了在理解与生成自然视频方面的卓越成果,但在卡通领域并不够有效。通过我们的实证实验,我们认为这种无效性源于手绘卡通中存在的显著偏差,这与自然视频的分布存在差异。我们能否利用这种规模化范式的成功,为卡通研究带来益处?然而,迄今为止,尚无可供探索的大型卡通数据集可用。在本研究中,我们提出了 Sakuga-42M 数据集,这是第一个大型卡通动画数据集。Sakuga-42M 包含覆盖多种艺术风格、地区和年份的 4200 万关键帧,包含详尽的语义标注,包括视频-文本描述对、动漫标签、内容分类等。我们通过在微调当代基础模型(如 Video CLIP、Video Mamba 和 SVD)上进行实验,首次展示了如此大规模卡通数据集在理解与生成任务中的显著优势,实现了与卡通相关任务的卓越性能。我们的动力是将大规模数据引入卡通研究,推动未来卡通应用的泛化与鲁棒性。数据集、代码和预训练模型将公开 disponible。
引用
@article{arxiv.2405.07425,
title = {Sakuga-42M Dataset: Scaling Up Cartoon Research},
author = {Zhenglin Pan},
journal= {arXiv preprint arXiv:2405.07425},
year = {2024}
}
备注
arXiv admin comment: This version has been removed by arXiv administrators as the submitter did not have the rights to agree to the license at the time of submission