中文

基于深度感知融合与有限训练数据的高效分割一切模型

计算机视觉与模式识别 2026-02-13 v1 图像与视频处理

摘要

分割一切模型(SAM)实现了令人印象深刻的通用分割性能,但需要海量数据集(例如 1100 万张图像)并且仅依赖 RGB 输入。最近的高效变体减少了计算量,但仍然依赖于大规模训练。我们提出了一个轻量级的 RGB-D 融合框架,该框架用单目深度先验增强了 EfficientViT-SAM。深度图使用预训练的估计器生成,并通过专用的深度编码器在中间层与 RGB 特征融合。仅在 11.2k 样本(不到 SA-1B 的 0.1%)上训练,我们的方法就实现了比 EfficientViT-SAM 更高的准确率,这表明深度线索为分割提供了强大的几何先验。

关键词

引用

@article{arxiv.2602.11804,
  title  = {Efficient Segment Anything with Depth-Aware Fusion and Limited Training Data},
  author = {Yiming Zhou and Xuenjie Xie and Panfeng Li and Albrecht Kunz and Ahmad Osman and Xavier Maldague},
  journal= {arXiv preprint arXiv:2602.11804},
  year   = {2026}
}