Ov3R: 基于RGB视频的开放词汇语义三维重建
计算机视觉与模式识别
2025-12-03 v2
摘要
我们提出了Ov3R,一个新颖的基于RGB视频流的开放词汇语义三维重建框架,旨在推进空间人工智能。该系统包含两个关键组件:CLIP3R,一个基于CLIP的三维重建模块,可从重叠片段预测密集点图并嵌入对象级语义;以及2D-3D OVS,一个二维-三维开放词汇语义模块,通过学习融合空间、几何和语义线索的融合描述符,将二维特征提升到三维。与先前方法不同,Ov3R直接将CLIP语义融入重建过程,实现了全局一致的几何结构和细粒度的语义对齐。我们的框架在密集三维重建和开放词汇三维分割方面均达到了最先进的性能,标志着向实时、语义感知的空间人工智能迈出了一步。
引用
@article{arxiv.2507.22052,
title = {Ov3R: Open-Vocabulary Semantic 3D Reconstruction from RGB Videos},
author = {Ziren Gong and Xiaohan Li and Fabio Tosi and Jiawei Han and Stefano Mattoccia and Jianfei Cai and Matteo Poggi},
journal= {arXiv preprint arXiv:2507.22052},
year = {2025}
}