中文

OneTo3D:从单张图像到可重编辑动态3D模型及视频生成

计算机视觉与模式识别 2024-05-13 v1

摘要

从单张图像到可编辑动态3D模型及视频生成,是单图像3D表示或图像3D重建研究领域的一个新方向与变革。与原始的神经辐射场相比,高斯溅射已显示出其在隐式3D重建中的优势。随着技术和原理的快速发展,人们尝试使用Stable Diffusion模型根据文本指令生成目标模型。然而,使用常规的隐式机器学习方法难以获得精确的运动和动作控制,此外,生成内容长且语义连续的3D视频也十分困难。为解决这一问题,我们提出了OneTo3D,这是一种使用单张图像生成可编辑3D模型并生成目标语义连续、时长无限的3D视频的方法与理论。我们使用一个常规的基础高斯溅射模型从单张图像生成3D模型,这需要较少的显存和计算能力。随后,我们为物体骨架设计了一种自动生成与自适应绑定机制。结合我们提出的可重编辑运动与动作分析及控制算法,我们能够在构建3D模型精确运动与动作控制,以及根据输入文本指令生成稳定、语义连续、时长无限的3D视频方面,取得优于SOTA项目的性能。本文将分析详细的实现方法和理论。将给出相关的比较和结论。项目代码已开源。

关键词

引用

@article{arxiv.2405.06547,
  title  = {OneTo3D: One Image to Re-editable Dynamic 3D Model and Video Generation},
  author = {Jinwei Lin},
  journal= {arXiv preprint arXiv:2405.06547},
  year   = {2024}
}

备注

24 pages, 13 figures, 2 tables