融合学习特征与通用视觉特征的玻璃分割
计算机视觉与模式识别
2026-03-05 v1
摘要
从 RGB 图像中对玻璃表面进行分割是一个具有挑战性的任务,因为玻璃作为一种透明材料明显缺乏视觉特征。然而,玻璃分割对于场景理解和机器人技术至关重要,因为必须将透明玻璃表面识别为固体材料。本文提出了一种新型架构用于玻璃分割,采用双主干网络产生通用视觉特征和任务特定的学习视觉特征。通用视觉特征由冻结的 DINOv3 视觉基础模型产生,而任务特定特征由在监督方式下训练的 Swin 模型生成。结果得到的多尺度特征表示经经历残差 Squeeze-and-Excitation Channel Reduction,然后输入 Mask2Former 解码器,产生最终的分割掩码。该架构在四个常用的玻璃分割数据集上进行评估,在几个准确度指标上实现了最先进的结果。该模型在推断速度方面也与之前的最先进方法具有竞争力,并且在使用更轻量级的 DINOv3 主干变体时超过了它。实现源代码和模型权重均可在:https://github.com/ojalar/lgnet 获取。
引用
@article{arxiv.2603.03718,
title = {Glass Segmentation with Fusion of Learned and General Visual Features},
author = {Risto Ojala and Tristan Ellison and Mo Chen},
journal= {arXiv preprint arXiv:2603.03718},
year = {2026}
}