MV-RAG:基于多视图扩散的检索增强方法
计算机视觉与模式识别
2025-08-25 v1 人工智能
摘要
文本到 3D 生成方法通过利用预训练的 2D 扩散先验取得了显著进展,能够产生高质量且 3D 一致的输出。然而,这类方法常在生成超出域(OOD)或罕见概念时表现不佳,导致不一致或不准确的结果。为此,我们提出 MV-RAG,一种新型文本到 3D 流水线,该方法首先从大型野生 2D 数据库中检索相关 2D 图像,然后以这些图像为条件,驱动多视图扩散模型以合成一致且准确的多视图输出。通过一种新颖的混合策略实现检索条件化模型的训练,该策略桥接了结构化的多视图数据与多样化的 2D 图像集合。这涉及:(1) 针对视图特定的重建,在条件视图上进行数据增强以模拟检索方差;(2) 在检索到的真实 2D 图像集合上训练,采用独特的留出视图预测目标:模型从其他视图预测留出视图,以从 2D 数据推断 3D 一致性。为促进严格的 OOD 评估,我们引入了一套具备挑战性的 OOD 提示集合。针对文本到 3D、图像到 3D 以及个性化基线进行实验,结果表明我们的方法在 OOD/罕见概念上显著提升了 3D 一致性、照片写实性和文本遵循性,同时在标准基准上保持竞争性能。
引用
@article{arxiv.2508.16577,
title = {MV-RAG: Retrieval Augmented Multiview Diffusion},
author = {Yosef Dayani and Omer Benishu and Sagie Benaim},
journal= {arXiv preprint arXiv:2508.16577},
year = {2025}
}
备注
Project page: https://yosefdayani.github.io/MV-RAG