ROAR-3D: 路由任意视角实现高保真 3D 生成
计算机视觉与模式识别
2026-05-21 v1 图形学
摘要
单图像到 3D 生成模型已能产生高质量几何结构,但仅依赖单一视角不可避免地引入不可见区域的歧义。多视角条件化可减少此类歧义,但现有方法要么要求固定规范视角,要么依赖外部重建模块,导致训练成本高昂并限制生成质量。我们观察到,预训练的单视角模型已具备强大的 2D 到 3D grounding 能力,可复用于多视角条件化。然而,更深入的分析揭示,其条件化机制将方向控制与几何传递 entangled,这两种功能在将不同视角的图像简单组合时会产生冲突。基于此,我们提出 ROAR-3D,一种轻量级方法,使预训练的单视角模型能够接受任意数量的未定位图像。Token 级视角路由为每个 3D 隐式 token 分配最相关的视角,从而在无需显式姿态输入的情况下隐式建立 2D 到 3D 对应关系。双流注意力设计保留了预训练主视角行为,同时将辅助视角路由通过专用于几何丰富化的独立路径。方向扰动策略确保辅助路径学习方向无关的几何传递。这些组件引入极少的可训练参数,仅在推理层面上对单视角基线产生可忽略的开销。ROAR-3D 实现了多视角 3D 生成质量的领先水平,并支持从 1 到 12+ 视角的测试时视角扩展,始终一致地获得改进。
引用
@article{arxiv.2605.21121,
title = {ROAR-3D: Routing Arbitrary Views for High-Fidelity 3D Generation},
author = {Hanxiao Sun and Mingxin Yang and Shuhui Yang and Zebin He and Xintong Han and Hongbo Fu and Chunchao Guo and Wenhan Luo},
journal= {arXiv preprint arXiv:2605.21121},
year = {2026}
}