面向 3D 高斯溶解的对象中心表示学习
计算机视觉与模式识别
2026-04-13 v1
摘要
最近的工作利用 2D 掩码来自视觉基础模型 (VFMs) 的掩码,以监督 radiance fields,实现实例级 3D 分段。然而,来自基础模型的监督信号并非从根本上对象中心化,往往需要额外的掩码预处理/后处理或专门的训练和损失设计来解决跨视角的掩码身份冲突。所学得的 3D 场景身份是 scene-dependent 的,限制了其在不同场景间的可泛化性。因此,我们提出一种基于数据集层面的对象中心监督方案,用于学习 3D 高斯溶解 (3DGS) 中的对象表示。基于预训练的基于 slot 注意力的全局对象中心学习 (Global Object Centric Learning, GOCL) 模块,我们学习一个 scene-agnostic 对象码本,提供跨视角和跨场景一致的、以身份为锚的表示。通过将码本与模块的无监督对象掩码耦合,我们可以直接监督 3D 高斯的身份特征,而无需额外的掩码预处理/后处理或显式的多视角对齐。所学的 scene-agnostic 码本使我们能够在无需 per-scene 微调或重新训练的情况下实现对象监督和识别。我们的方法因此将无监督对象中心学习 (OCL) 引入 3DGS,产生更结构化的表示和更好的泛化,适用于机器人交互、场景理解和跨场景泛化等下游任务。
引用
@article{arxiv.2604.09045,
title = {Scene-Agnostic Object-Centric Representation Learning for 3D Gaussian Splatting},
author = {Tsuheng Hsu and Guiyu Liu and Juho Kannala and Janne Heikkilä},
journal= {arXiv preprint arXiv:2604.09045},
year = {2026}
}