拥抱多样性:超越每个类别一个向量的可解释零样本分类
计算机视觉与模式识别
2024-04-26 v1 人工智能
人机交互
摘要
视觉语言模型能够在无需任何 retraining 的情况下对对象进行开放式分类。尽管这一零样本范式标志着重大进展,但当对象与其典型表现形式差异较大时,当前最佳模型仍表现出偏斜的性能。现实中的物体(如梨)会以多种形态出现——从切块到整颗,放置在桌上或碗中——但标准的 VLM 分类器会将该类别的所有实例映射到一个基于类别标签的单一向量上。我们认为,要代表一个类别内部的丰富多样性,零样本分类需要超越单一向量。我们提出了一种方法,通过推断属性来编码和考虑类别内的多样性,仍在零样本设置下无需 retraining。我们发现,该方法在涵盖层次结构、多样对象状态和真实地理多样性的数据集上,以及 intra-class 多样性较少的细粒度数据集上, consistently 优于标准零样本分类。重要的是,我们的方法是内在可解释的,为每个推断提供忠实的解释,以促进模型调试并提高透明度。我们还发现该方法能够高效地扩展到大量属性以考虑多样性——这导致对 atypical 实例的预测更加准确。最后,我们对整体准确率与最差类别准确率之间原则性的权衡进行了表征,这可以通过我们方法的一个超参数进行调节。我们希望这项工作能激发进一步的研究,以探索零样本分类捕捉世界多样性的潜力,以及在不损失性能的前提下构建透明 AI 系统。
引用
@article{arxiv.2404.16717,
title = {Embracing Diversity: Interpretable Zero-shot classification beyond one vector per class},
author = {Mazda Moayeri and Michael Rabbat and Mark Ibrahim and Diane Bouchacourt},
journal= {arXiv preprint arXiv:2404.16717},
year = {2024}
}
备注
Accepted to FAccT 2024