基于零样本学习的透明与不透明饮用玻璃语义分割
计算机视觉与模式识别
2025-03-20 v1
摘要
分割图像中的透明结构具有挑战性,因为它们难以与背景区分。常见的例子是饮用玻璃,它们是我们生活中无处不在的一部分,呈现许多不同的形状和尺寸。在这项工作中,我们提出了 TransCaGNet,它是零样本模型 CaGNet 的修改版本。我们将分割骨干网络替换为 Trans4Trans 的架构,以具备分割透明对象的能力。由于某些玻璃很少被拍摄到,我们使用零样本学习来能够对训练期间未给出的玻璃类别进行语义分割。我们提出了一种覆盖多种不同环境条件的新颖合成数据集。此外,我们收集了一个真实世界评估数据集,因为大多数应用发生在现实世界中。与 Zeg-Clip 的比较表明,TransCaGNet 产生了更好的平均 IoU 和准确率值,而 ZegClip 在未见类别上大多优于它。为了提高分割结果,我们将模型的语义分割结果与 SAM 2 的分割结果相结合。我们的评估强调,由于相似性、视角或遮挡,区分不同类别对模型来说具有挑战性。考虑到这种行为,我们为玻璃分配了多个可能的类别。该修改在合成数据集上将平均 IoU 提高了最多 13.68%,将平均准确率提高了最多 17.88%。使用我们困难的合成数据集进行训练,模型在真实世界数据集上产生了更好的结果。平均 IoU 提高了最多 5.55%,平均准确率提高了最多 5.72%。
引用
@article{arxiv.2503.15004,
title = {Semantic Segmentation of Transparent and Opaque Drinking Glasses with the Help of Zero-shot Learning},
author = {Annalena Blänsdorf and Tristan Wirth and Arne Rak and Thomas Pöllabauer and Volker Knauthe and Arjan Kuijper},
journal= {arXiv preprint arXiv:2503.15004},
year = {2025}
}