视觉 Transformer 是优秀的掩码自动标注器
计算机视觉与模式识别
2023-01-11 v1 机器学习
多媒体
摘要
我们提出掩码自动标注器(MAL),一种基于 Transformer 的高质量掩码自动标注框架,仅使用框标注进行实例分割。MAL 以框裁剪图像作为输入,并有条件地生成其掩码伪标签。我们表明视觉 Transformer 是优秀的掩码自动标注器。我们的方法在掩码质量方面显著缩小了自动标注与人类标注之间的差距。使用 MAL 生成的掩码训练的实例分割模型几乎可以匹配其全监督对应模型的性能,保留高达全监督模型 97.4% 的性能。最佳模型在 COCO 实例分割(test-dev 2017)上实现了 44.1% mAP,显著优于最先进的框监督方法。定性结果表明,在某些情况下,MAL 产生的掩码甚至优于人类标注。
引用
@article{arxiv.2301.03992,
title = {Vision Transformers Are Good Mask Auto-Labelers},
author = {Shiyi Lan and Xitong Yang and Zhiding Yu and Zuxuan Wu and Jose M. Alvarez and Anima Anandkumar},
journal= {arXiv preprint arXiv:2301.03992},
year = {2023}
}