SimpleClick:基于简单视觉变换器的交互式图像分割
计算机视觉与模式识别
2023-03-14 v3
摘要
基于点击的交互式图像分割旨在以有限的用户点击提取对象。分层主干是当前方法事实上的架构。近来,扁平、非分层的视觉变换器(ViT)已成为密集预测任务中具有竞争力的主干。该设计允许原始 ViT 作为基础模型,无需为预训练重新设计分层主干即可微调用于下游任务。尽管该设计简单且已被证明有效,但尚未在交互式图像分割中被探索。为填补此空白,我们提出 SimpleClick,首个利用扁平主干的交互式分割方法。基于扁平主干,我们引入对称块嵌入层,以对主干本身的微小修改将点击编码入主干。借助作为掩码自编码器(MAE)预训练的扁平主干,SimpleClick 取得了最先进的性能。值得注意的是,我们的方法在 SBD 上达到 4.15 NoC@90,较此前最佳结果提升 21.8%。在医学图像上的广泛评测证明了我们方法的泛化性。我们进一步为 SimpleClick 开发了极微小的 ViT 主干,并给出详细的计算分析,凸显其作为实用标注工具的适用性。
引用
@article{arxiv.2210.11006,
title = {SimpleClick: Interactive Image Segmentation with Simple Vision Transformers},
author = {Qin Liu and Zhenlin Xu and Gedas Bertasius and Marc Niethammer},
journal= {arXiv preprint arXiv:2210.11006},
year = {2023}
}
备注
Tech report. Update 03/11/2023: Add results on a tiny model and append supplementary materials