中文

无像素级监督的共分割及其在大规模草图分类中的应用

计算机视觉与模式识别 2024-10-18 v1

摘要

本工作提出了一种用于对象共分割的方法,即在一组图像中对常见对象的像素级定位,该方法在训练时不使用像素级监督。两个预训练的视觉转换器(ViT)模型被利用:ImageNet 分类训练的 ViT 用于通过类内 token 相关性估计粗略对象定位,以及自监督 DINO-ViT 用于图像内的 token 相关性。在最近具有挑战性的基准数据集上,该方法在与在相同监督水平(图像标签)下训练的方法相比时实现了最好的性能,同时与使用像素级监督(二值掩码)训练的方法保持竞争力。该共分割方法的优势进一步在大规模草图识别任务中得到体现,即将草图分类到广泛的类别中。利用从边缘检测自然图像中提取的草图样子域,利用可获得的图像级别标注数据集中包含大量类别的自然图像。为了弥合领域差距,分类器在草图样子域上进行训练。我们展示了,草图识别在从共分割区域提取的草图结构上进行训练(而不是从完整图像上)时显著受益。代码:https://github.com/nikosips/CBNC

关键词

引用

@article{arxiv.2410.13582,
  title  = {Co-Segmentation without any Pixel-level Supervision with Application to Large-Scale Sketch Classification},
  author = {Nikolaos-Antonios Ypsilantis and Ondřej Chum},
  journal= {arXiv preprint arXiv:2410.13582},
  year   = {2024}
}

备注

ACCV 2024 Main Paper + Supplementary (Appendix)