AnimateZoo:基于主体对齐的跨物种动画零样本视频生成
计算机视觉与模式识别
2024-04-09 v1
摘要
近期的视频编辑进展依赖于准确的姿态序列来为主体生成动画。然而,由于物种间的姿态不对齐(例如,由于身体结构的差异,猫的姿态与猪的姿态大相径庭),这些方法并不适用于跨物种动画。在本文中,我们提出了 AnimateZoo,一种基于扩散的零样本视频生成器,旨在解决这一具有挑战性的跨物种动画问题,力求在保留背景的同时准确生成动物动画。我们 AnimateZoo 中使用的关键技术是主体对齐,包含两个步骤。首先,我们通过集成拉普拉斯细节增强器和提示微调身份提取器来改进外观特征提取。这些组件专为捕获关键的外观信息而设计,包括身份和精细细节。其次,我们通过引入尺度信息移除器来对齐形状特征并解决不同主体带来的冲突。这确保了准确的跨物种动画。此外,我们引入了两个包含多种物种的高质量动物视频数据集。在这些海量数据集上训练后,我们的模型能够生成具有动作准确、外观一致和高保真帧特征的视频,而无需先前方法所需的推理前微调。大量实验展示了我们的方法在跨物种动作跟随任务中的优异性能,证明了其卓越的形状适应能力。项目主页可在 https://justinxu0.github.io/AnimateZoo/ 获取。
引用
@article{arxiv.2404.04946,
title = {AnimateZoo: Zero-shot Video Generation of Cross-Species Animation via Subject Alignment},
author = {Yuanfeng Xu and Yuhao Chen and Zhongzhan Huang and Zijian He and Guangrun Wang and Philip Torr and Liang Lin},
journal= {arXiv preprint arXiv:2404.04946},
year = {2024}
}
备注
Technical report,15 pages