LRM:从单张图像到三维的大重建模型
计算机视觉与模式识别
2024-03-12 v2 人工智能
图形学
机器学习
摘要
我们提出了首个大重建模型(Large Reconstruction Model,LRM),它能在仅 5 秒内从单张输入图像预测物体的三维模型。与许多先前在 ShapeNet 等小规模数据集上以类别特定方式训练的方法不同,LRM 采用高度可扩展的基于 transformer 的架构,具有 5 亿可学习参数,直接从输入图像预测神经辐射场(NeRF)。我们在包含约 100 万个物体的大规模多视图数据上以端到端方式训练模型,包括来自 Objaverse 的合成渲染图和来自 MVImgNet 的真实捕获。这种高容量模型与大规模训练数据的结合使我们的模型具有高度泛化能力,并能从各种测试输入(包括真实世界野外部署捕获和生成模型创建的图像)产生高质量的三维重建。视频演示和可交互三维网格可在我们的 LRM 项目网页查看:https://yiconghong.me/LRM。
引用
@article{arxiv.2311.04400,
title = {LRM: Large Reconstruction Model for Single Image to 3D},
author = {Yicong Hong and Kai Zhang and Jiuxiang Gu and Sai Bi and Yang Zhou and Difan Liu and Feng Liu and Kalyan Sunkavalli and Trung Bui and Hao Tan},
journal= {arXiv preprint arXiv:2311.04400},
year = {2024}
}
备注
ICLR 2024