面向图像、三维动画与视频的条件生成建模
计算机视觉与模式识别
2023-10-23 v1 人工智能
机器学习
摘要
本学位论文试图通过探索条件生成模型的新公式,以及图像、三维动画和视频中的创新应用,推动计算机视觉生成建模领域的创新。我们的研究聚焦于提供噪声与视觉数据可逆变换的架构,以及将编码器-解码器架构应用于生成任务和三维内容操控。在所有实例中,我们引入条件信息以增强视觉数据的合成,提升生成过程的效率以及所生成内容的质量。我们引入 Neural ODEs 以使用编码器-解码器架构建模视频动态,证明其虽仅被训练来重建当前帧却能预测未来视频帧的能力。接下来,我们提出连续归一化流的条件变体,能够基于低分辨率输入实现更高分辨率图像生成,在减少参数与训练时间的同时达到可比的图像质量。我们接下来的贡献提出了一个流程,以人体图像为输入,自动将用户指定的三维角色与人体姿态对齐,并基于部分输入实现姿态编辑。随后,我们推导了使用非各向同性高斯过程的去噪扩散模型的相关数学细节,并展示了可比的生成质量。最后,我们设计了一种新颖的去噪扩散框架,能够解决预测、生成与插值全部三种视频任务。我们进行了消融研究,并在多个数据集上展示了 SOTA 结果。我们的贡献已作为同行评审会议文章发表。总体而言,我们的研究旨在为追求更高效与灵活的生成模型做出有意义贡献,并有可能塑造计算机视觉的未来。
引用
@article{arxiv.2310.13157,
title = {Conditional Generative Modeling for Images, 3D Animations, and Video},
author = {Vikram Voleti},
journal= {arXiv preprint arXiv:2310.13157},
year = {2023}
}
备注
Doctoral thesis, Mila, University of Montreal. 189 pages