中文

3AM:在视频中实现几何一致性的 3 维分割

计算机视觉与模式识别 2026-04-17 v5

摘要

视频对象分割方法如 SAM2 通过基于记忆的架构实现卓越的性能,但在大幅视角变化时难以应对,因其依赖外观特征。传统的 3D 实例分割方法解决了视角一致性问题,但需要相机姿态、深度图以及昂贵的预处理。我们引入 3AM,这是一种训练时增强方法,将 MUSt3R 中的 3D aware 特征集成到 SAM2 中。我们的轻量级特征融合器融合多级 MUSt3R 特征,这些特征编码了隐式的几何对应关系。结合 SAM2 的外观特征,该模型在空间位置和视觉相似性之间实现几何一致的识别。我们提出一种基于视场感知的采样策略,确保帧观察到的物体区域在空间上是一致的,以实现可靠的 3D 对应学习。 critically,our method requires only RGB input at inference, with no camera poses or preprocessing. 在涵盖宽基线运动的数据集(ScanNet++、Replica)上,3AM 在 ScanNet++ 的 Selected Subset 上实现 90.6% 的 IoU 和 71.7% 的跟踪召回率,显著超过 SAM2 和其扩展方法,分别提升了 15.9 和 30.4 分。项目页面:https://jayisaking.github.io/3AM-Page/。

关键词

引用

@article{arxiv.2601.08831,
  title  = {3AM: 3egment Anything with Geometric Consistency in Videos},
  author = {Yang-Che Sun and Cheng Sun and Chin-Yang Lin and Fu-En Yang and Min-Hung Chen and Yen-Yu Lin and Yu-Lun Liu},
  journal= {arXiv preprint arXiv:2601.08831},
  year   = {2026}
}

备注

Project page: https://jayisaking.github.io/3AM-Page/