PEEB:具有可解释且可编辑语言瓶颈的基于部件的图像分类器
计算机视觉与模式识别
2024-04-16 v3 人工智能
计算与语言
摘要
基于 CLIP 的分类器依赖于包含文本编码器已知{类别名称}的提示。因此,它们在新类别或那些名称在互联网上极少出现的类别(例如鸟类的科学名称)上表现不佳。针对细粒度分类,我们提出了 PEEB——一种可解释且可编辑的分类器,用于:(1) 将类别名称表达为一组描述该类别视觉部件的文本描述符;(2) 将检测到的部件的嵌入与每个类别的文本描述符进行匹配,以计算用于分类的 logit 分数。在类别名称未知的零样本设置中,PEEB 的表现大幅优于 CLIP(top-1 准确率提高约 10 倍)。与基于部件的分类器相比,PEEB 不仅在监督学习设置中达到了最先进水平(SOTA)(在 CUB-200 和 Dogs-120 上的准确率分别为 88.80% 和 92.20%),而且是首个允许用户编辑文本描述符以形成新分类器而无需任何重新训练的方法。与概念瓶颈模型相比,PEEB 在零样本和监督学习设置中也都达到了 SOTA。
引用
@article{arxiv.2403.05297,
title = {PEEB: Part-based Image Classifiers with an Explainable and Editable Language Bottleneck},
author = {Thang M. Pham and Peijie Chen and Tin Nguyen and Seunghyun Yoon and Trung Bui and Anh Totti Nguyen},
journal= {arXiv preprint arXiv:2403.05297},
year = {2024}
}
备注
Findings of NAACL 2024 (long paper)