LatentMan: 基于图像扩散模型生成一致的动画角色
计算机视觉与模式识别
2024-06-04 v2 机器学习
摘要
我们提出了一种基于文本到图像(Text-to-Image, T2I)扩散模型生成一致动画角色视频的零样本方法。现有的文本到视频(Text-to-Video, T2V)方法训练成本高昂,且需要大规模视频数据集才能生成多样化的角色与动作。同时,其零样本替代方法无法生成具有连续运动的时序一致视频。我们致力于弥补这一差距,并提出了 LatentMan,该方法利用现有的基于文本的运动扩散模型生成多样化的连续运动,以指导 T2I 模型。为增强时序一致性,我们引入了空间隐式对齐模块,该模块利用我们计算出的跨帧密集对应关系来对齐视频帧的隐式表示。此外,我们提出了逐像素引导,以最小化帧间视觉差异的方向引导扩散过程。在逐像素一致性和用户偏好方面,我们提出的方法在生成动画角色视频上优于现有的零样本 T2V 方法。项目页面 https://abdo-eldesokey.github.io/latentman/。
引用
@article{arxiv.2312.07133,
title = {LatentMan: Generating Consistent Animated Characters using Image Diffusion Models},
author = {Abdelrahman Eldesokey and Peter Wonka},
journal= {arXiv preprint arXiv:2312.07133},
year = {2024}
}
备注
CVPRW 2024. Project page: https://abdo-eldesokey.github.io/latentman/