中文

为性能而胡乱堆词:基于随机词与宽泛概念的视觉分类

计算机视觉与模式识别 2023-08-21 v2 机器学习

摘要

诸如 CLIP 之类的视觉-语言模型的视觉分类性能已被证明受益于来自大型语言模型(LLM)如 GPT-3 的额外语义知识。具体而言,对 LLM 生成的类别描述符(例如“华夫饼,具有圆形形状”)取平均可显著提升泛化性能。在本工作中,我们批判性地研究这一行为,并提出 WaffleCLIP,一种零样本视觉分类框架,其仅以随机字符和单词描述符替换 LLM 生成的描述符。无需查询外部模型,我们便在大量视觉分类任务上取得了相当的的性能提升。这使得 WaffleCLIP 既可作为低成本替代方案,也可作为对任意未来基于 LLM 的视觉-语言模型扩展的合理性检验。我们对 LLM 生成描述符引入的额外语义的影响与不足进行了广泛的实验研究,并展示了如何——在可行时——通过查询 LLM 获取高层概念来更好地利用语义上下文,我们表明此举可联合消解潜在的类名歧义。代码见:https://github.com/ExplainableML/WaffleCLIP。

关键词

引用

@article{arxiv.2306.07282,
  title  = {Waffling around for Performance: Visual Classification with Random Words and Broad Concepts},
  author = {Karsten Roth and Jae Myung Kim and A. Sophia Koepke and Oriol Vinyals and Cordelia Schmid and Zeynep Akata},
  journal= {arXiv preprint arXiv:2306.07282},
  year   = {2023}
}

备注

Accepted to ICCV 2023. Main paper with 9 pages