中文

Carve3D:通过强化学习微调提升扩散模型的多视图重建一致性

计算机视觉与模式识别 2024-04-11 v2 机器学习

摘要

通过对文本到图像扩散模型应用监督微调(SFT)而获得的多视图扩散模型,推动了近期文本到 3D 研究的突破。然而,由于现有 3D 数据集的规模与质量有限,这些模型仍然存在多视图不一致以及神经辐射场(NeRF)重建伪影的问题。我们认为,多视图扩散模型可以从进一步的强化学习微调(RLFT)中受益,这使得模型能够从自身生成的数据中学习,并在 SFT 阶段突破数据集的局限进行改进。为此,我们提出了 Carve3D,这是一种改进的 RLFT 算法,结合了一种新颖的多视图重建一致性(MRC)度量,以增强多视图扩散模型的一致性。为了在一组多视图图像上度量 MRC 指标,我们将其与相同相机视点下的对应 NeRF 渲染结果进行比较。我们将由此得到的模型称为 Carve3DM,它展现出优于现有模型的多视图一致性与 NeRF 重建质量。我们的结果表明,将 SFT 与 Carve3D 的 RLFT 相结合对于开发多视图一致的扩散模型至关重要,这反映了标准的大语言模型(LLM)对齐流程。我们的代码、训练与测试数据以及视频结果可在以下网址获取:https://desaixie.github.io/carve-3d。

关键词

引用

@article{arxiv.2312.13980,
  title  = {Carve3D: Improving Multi-view Reconstruction Consistency for Diffusion Models with RL Finetuning},
  author = {Desai Xie and Jiahao Li and Hao Tan and Xin Sun and Zhixin Shu and Yi Zhou and Sai Bi and Sören Pirk and Arie E. Kaufman},
  journal= {arXiv preprint arXiv:2312.13980},
  year   = {2024}
}

备注

22 pages, 16 figures. Our code, training and testing data, and video results are available at: https://desaixie.github.io/carve-3d. This paper has been accepted to CVPR 2024. v2: incorporated changes from the CVPR 2024 camera-ready version