为视觉与语言模型学习类别命名
计算机视觉与模式识别
2023-04-05 v1
摘要
大规模视觉与语言模型可以通过将类别特定的文本查询映射到图像内容来实现令人印象深刻的零样本识别性能。然而,两个显著的挑战仍然存在:一是对定义查询的手动设计类别名称的选择高度敏感,二是难以适应新的、更小的数据集。针对这些问题,我们提出利用可用数据,为每个类别学习一个作为视觉内容函数的最优词嵌入。通过在其他部分冻结的模型上学习新的词嵌入,我们能够保留对新类别的零样本能力,轻松将模型适配到新数据集,并调整潜在错误、缺乏描述性或存在歧义的类别名称。我们展示了我们的方案可以轻松集成到图像分类和目标检测流程中,在多种场景下带来显著的性能提升,并揭示模型偏差与标注错误。
引用
@article{arxiv.2304.01830,
title = {Learning to Name Classes for Vision and Language Models},
author = {Sarah Parisot and Yongxin Yang and Steven McDonagh},
journal= {arXiv preprint arXiv:2304.01830},
year = {2023}
}
备注
Accepted to CVPR 2023