中文

AREA3D:具有统一前馈三维感知与视觉-语言引导的主动重建智能体

计算机视觉与模式识别 2025-12-08 v1 人工智能 机器人学

摘要

主动三维重建使智能体能够自主选择视角以高效获取准确且完整的场景几何,而非从预先采集的图像中被动重建场景。然而,现有的主动重建方法通常依赖手工设计的几何启发式规则,这可能导致冗余观测而无法实质性地提高重建质量。为解决这一局限,我们提出了AREA3D,一个利用前馈三维重建模型与视觉-语言引导的主动重建智能体。我们的框架将视角不确定性建模与底层前馈重建器解耦,从而在不进行昂贵的在线优化的情况下实现精确的不确定性估计。此外,集成的视觉-语言模型提供高层语义引导,鼓励超越纯几何线索的信息丰富且多样化的视角。在场景级和对象级基准上的广泛实验表明,AREA3D达到了最先进的重建精度,特别是在稀疏视角条件下。代码将在以下地址公开:https://github.com/TianlingXu/AREA3D 。

关键词

引用

@article{arxiv.2512.05131,
  title  = {AREA3D: Active Reconstruction Agent with Unified Feed-Forward 3D Perception and Vision-Language Guidance},
  author = {Tianling Xu and Shengzhe Gan and Leslie Gu and Yuelei Li and Fangneng Zhan and Hanspeter Pfister},
  journal= {arXiv preprint arXiv:2512.05131},
  year   = {2025}
}

备注

Under review