中文

自监督视觉Transformer:面向非完美标签的高效语义分割学习器

计算机视觉与模式识别 2024-01-24 v1

摘要

本研究展示了一种利用自监督视觉Transformer(SSVT)进行语义分割的经济高效方法。通过冻结SSVT骨干网络并训练一个轻量级分割头,我们的方法有效利用了非完美标签,从而提高了对标签缺陷的鲁棒性。实证实验表明,对于包括涂鸦、点级和图像级标签在内的多种标注类型,该方法相比现有方法有显著的性能提升。该研究突显了自监督视觉Transformer在处理非完美标签方面的有效性,为语义分割提供了一种实用且高效的解决方案,同时降低了标注成本。通过大量实验,我们证实,对于所有类型的非完美标签,我们的模型性能均优于基线模型。特别是在基于零样本视觉语言模型的标签下,我们的模型相比基线实现了11.5个百分点的性能增益。

关键词

引用

@article{arxiv.2401.12535,
  title  = {Self-Supervised Vision Transformers Are Efficient Segmentation Learners for Imperfect Labels},
  author = {Seungho Lee and Seoungyoon Kang and Hyunjung Shim},
  journal= {arXiv preprint arXiv:2401.12535},
  year   = {2024}
}

备注

AAAI2024 Edge Intelligence Workshop (EIW) accepted