PDiscoFormer:利用视觉 Transformer 放宽部件发现约束
计算机视觉与模式识别
2024-07-23 v3 人工智能
机器学习
摘要
显式检测物体部件并基于其进行推理的计算机视觉方法是迈向本质可解释模型的一步。现有的由细粒度分类任务驱动的部件发现方法对所发现部件的几何性质做出了非常严格的假设:它们应当是微小且紧凑的。尽管这种先验在某些情况下是有用的,但在本文中,我们展示了基于预训练 Transformer 的视觉模型(如自监督 DINOv2 ViT)能够放宽这些约束。具体而言,我们发现允许任意大小多个连通分量的全变分(TV)先验显著优于先前的工作。我们在三个细粒度分类基准上测试了我们的方法:CUB、PartImageNet 和 Oxford Flowers,并将我们的结果与已发表的方法以及基于 Transformer 主干重新实现的最先进方法 PDiscoNet 进行了比较。我们在部件发现指标和下游分类任务上均取得了一致的显著提升,这表明自监督 ViT 模型中强大的归纳偏置需要重新思考可用于无监督部件发现的几何先验。
引用
@article{arxiv.2407.04538,
title = {PDiscoFormer: Relaxing Part Discovery Constraints with Vision Transformers},
author = {Ananthu Aniraj and Cassio F. Dantas and Dino Ienco and Diego Marcos},
journal= {arXiv preprint arXiv:2407.04538},
year = {2024}
}
备注
Accepted as a main conference paper at the European Conference of Computer Vision (ECCV) 2024