AR-1-to-3:基于下一视角预测的单图像至一致性3D物体生成
计算机视觉与模式识别
2025-08-12 v4
摘要
新视角合成(NVS)是图像到3D创建的基石。然而,现有工作仍难以在生成视角和输入视角之间保持一致性,特别是当相机姿态差异显著时,导致3D几何和纹理质量较差。根据我们的经验观察,靠近输入视角的目标视角表现出更高的保真度,我们将此问题归因于它们对所有目标视角赋予同等优先级的处理方式。受此启发,我们提出了 AR-1-to-3,这是一种基于扩散模型的新颖下一视角预测范式,它首先生成靠近输入视角的视图,然后将其用作上下文信息以逐步合成更远的视图。为了将生成的视图子序列编码为下一视角预测的局部和全局条件,我们相应地开发了堆叠局部特征编码策略(Stacked-LE)和基于 LSTM 的全局特征编码策略(LSTM-GE)。大量实验表明,我们的方法显著提高了生成视图与输入视图之间的一致性,产生了高保真度的3D资产。
引用
@article{arxiv.2503.12929,
title = {AR-1-to-3: Single Image to Consistent 3D Object Generation via Next-View Prediction},
author = {Xuying Zhang and Yupeng Zhou and Kai Wang and Yikai Wang and Zhen Li and Shaohui Jiao and Daquan Zhou and Qibin Hou and Ming-Ming Cheng},
journal= {arXiv preprint arXiv:2503.12929},
year = {2025}
}
备注
Accepted at ICCV 2025; Project page: https://github.com/HVision-NKU/AR123