中文

图像描述信息教导零样本视觉识别

计算机视觉与模式识别 2024-12-06 v1 机器学习

摘要

视觉语言模型(VLMs)如 CLIP 因其在开放词汇概念上执行零样本视觉识别的能力而备受推崇。这一能力通过选择文本表示与查询图像相似性最高的对象类别来实现。虽然在某些领域取得成功,但此方法在识别细粒度实体和泛化到训练分布未捕获的未见概念方面仍面临挑战。最近的研究尝试通过集成测试时的类别描述来缓解这些挑战,尽管仅带来有限的改进。我们认为这些有限的收益源于图像和描述表示之间根本性的错位,这种错位源于 CLIP 的预训练结构。在本文中,我们提出了 GRAIN,一种新的预训练策略,旨在同时在细粒度和粗粒度水平上对表示进行对齐。我们的 метод学习到在图像区域内对文本描述进行联合 grounding,同时将概览说明与全局图像表示对齐。为驱动此预训练,我们利用冻结的多模态大语言模型(MLLMs)生成大规模合成注释。我们展示了相较于当前最先进方法,我们的模型在 11 个多样化图像分类数据集上实现了增强的零样本性能。此外,我们引入了 Products-2023 数据集,这是一个新精选的、手动标记的包含新概念的数据集,并展示了我们的模型在其上进行基准测试以识别这些概念的能力。我们模型在其他下游任务(如检索)上的显著改进进一步凸显了我们方法所学表示的优质性能。代码可在 https://github.com/shaunak27/grain-clip 获取。

关键词

引用

@article{arxiv.2412.04429,
  title  = {Grounding Descriptions in Images informs Zero-Shot Visual Recognition},
  author = {Shaunak Halbe and Junjiao Tian and K J Joseph and James Seale Smith and Katherine Stevo and Vineeth N Balasubramanian and Zsolt Kira},
  journal= {arXiv preprint arXiv:2412.04429},
  year   = {2024}
}