中文

TrackRef3D:面向开放世界的3D高斯溅写中指代语义分割的多视图一致轨迹-标签方法

计算机视觉与模式识别 2026-05-27 v1 机器学习

摘要

利用自然语言进行3D对象分割的指代式3D高斯溅写(R3DGS)已成为具身AI的关键能力。但现有方法通常依赖高昂的 per-scene 手动标注和 per-view 伪掩码生成,导致多视图不一致和对查询特定性差异性的泛化性差。为此,我们提出TrackRef3D,一个无需手动标注即可实现3D高斯溅写中开放世界指代语义分割的全自动管道,通过引入多视图一致的轨迹-标签范式从根本上解耦对象发现与语义对齐。具体而言,我们提出了轨迹感知语义共识模块(TSCM),通过同义聚类和轨迹感知投票汇聚跨视图预测,以建立规范语义身份,确保多视图一致性。此外,我们采用可见性感知的描述生成策略以缓解歧义,提出混合训练策略(HTS),以多正样本对比目标联合优化粗糙类别语义和细粒度指代线索,确保在查询特定性变化下的鲁棒性。广泛的实验表明,TrackRef3D 在基准测试上实现了最先进的性能。

关键词

引用

@article{arxiv.2605.26576,
  title  = {TrackRef3D: Multi-View Consistent Track-then-Label for Open-World Referring Segmentation in 3D Gaussian Splatting},
  author = {Yuyang Tan and Renhe Zhang and Hang Zhang and Ao Li and Xin Tan},
  journal= {arXiv preprint arXiv:2605.26576},
  year   = {2026}
}