Cascade-Zero123:利用自提示邻近视图从单张图像生成高度一致的三维模型
计算机视觉与模式识别
2024-08-09 v2 图形学
摘要
从单张图像合成多视图三维模型是一项重要但极具挑战性的任务。Zero-1-to-3 方法通过将二维潜在扩散模型提升到三维范畴取得了巨大成功。目标视图图像是利用单视图源图像和相机位姿作为条件信息生成的。然而,由于单张输入图像的高度稀疏性,Zero-1-to-3 往往会在不同视图间产生几何和外观的不一致性,尤其对于复杂物体。为解决此问题,我们提出以自提示的方式为生成模型提供更多条件信息。我们构建了一个包含两个 Zero-1-to-3 模型的级联框架,名为 Cascade-Zero123,该框架逐步从源图像中提取三维信息。具体而言,首先由第一个模型生成若干邻近视图,然后将这些视图与源图像一起作为生成条件馈入第二阶段模型。通过增强的自提示条件图像,我们的 Cascade-Zero123 能生成比 Zero-1-to-3 更一致的新视角图像。实验结果展示了显著的提升,尤其对于各种复杂且具有挑战性的场景,包括昆虫、人体、透明物体以及堆叠的多个物体等。更多演示和代码可在 https://cascadezero123.github.io 获取。
引用
@article{arxiv.2312.04424,
title = {Cascade-Zero123: One Image to Highly Consistent 3D with Self-Prompted Nearby Views},
author = {Yabo Chen and Jiemin Fang and Yuyang Huang and Taoran Yi and Xiaopeng Zhang and Lingxi Xie and Xinggang Wang and Wenrui Dai and Hongkai Xiong and Qi Tian},
journal= {arXiv preprint arXiv:2312.04424},
year = {2024}
}
备注
ECCV 2024. Project page: https://cascadezero123.github.io/