中文

MoonSeg3R: 利用重构基础先验的单目在线零样本 3D Segment Anything

计算机视觉与模式识别 2026-04-22 v2

摘要

在本文中,我们聚焦于在线零样本单目 3D 实例分割,这是一个现有方法因依赖已姿态化的 RGB-D 序列而无法有效执行的新型实用设置。为了克服这一限制,我们利用 CUT3R——一种近期的重构基础模型 (RFM)——来从单目 RGB 流中提供可靠的几何先验。我们提出 MoonSeg3R,它引入了三个关键组件:(1) 一个自监督查询细化模块,通过空间-语义蒸馏将来自 2D 视觉基础模型 (VFMs) 的分割掩码转换为判别性的 3D 查询;(2) 一个 3D 查询索引记忆,通过检索上下文查询来提供时间一致性;以及 (3) 一个来自 CUT3R 的状态分布标记,充当掩码身份描述符以增强跨帧融合。在 ScanNet200 和 SceneNN 上的实验表明 MoonSeg3R 是首个实现在线单目 3D 分割的方法,其性能与最先进的 RGB-D 基系统具有竞争力。我们的代码可在 https://github.com/VICO-UoE/MoonSeg3R 获取。

关键词

引用

@article{arxiv.2512.15577,
  title  = {MoonSeg3R: Monocular Online Zero-Shot Segment Anything in 3D with Reconstructive Foundation Priors},
  author = {Zhipeng Du and Duolikun Danier and Jan Eric Lenssen and Hakan Bilen},
  journal= {arXiv preprint arXiv:2512.15577},
  year   = {2026}
}

备注

CVPR 2026 Findings