预训练视觉-语言模型学习可发现的视觉概念
计算机视觉与模式识别
2025-01-15 v2 人工智能
计算与语言
机器学习
摘要
被预训练以对“榴莲”图像进行描述的视觉-语言模型(VLMs)是否同时学会了诸如“棕色”(颜色)和“多刺”(纹理)等视觉概念?我们旨在回答这个问题,因为“免费”学习到的视觉概念将能实现广泛的应用,如神经符号推理或人类可解释的物体分类。我们假设,如果预训练 VLMs 捕获了视觉概念,则可以通过其带有基于文本概念提示的视觉-语言接口将其提取出来。我们观察到,近期使用概念提示 VLMs 的工作在定义和评估视觉概念的策略上往往有所不同,从而导致了相互矛盾的结论。基于两个观察,我们提出了一种新的概念定义策略:首先,某些概念提示包含捷径,会因错误的原因识别出正确的概念;其次,在选择概念时应利用多模态信息(例如视觉显著性和文本知识)。因此,我们设计的概念发现与学习框架旨在识别一份多样的通用视觉概念列表(例如“多刺”而非“多刺的榴莲”),这些概念基于视觉和语言互信息进行排序和选择。我们在六个不同的视觉识别数据集上对所发现的概念精心设计了定量和人类评估,证实预训练 VLMs 确实学习到了视觉概念,能够为识别出的物体提供准确而全面的描述。所有代码和模型均已公开发布。
引用
@article{arxiv.2404.12652,
title = {Pre-trained Vision-Language Models Learn Discoverable Visual Concepts},
author = {Yuan Zang and Tian Yun and Hao Tan and Trung Bui and Chen Sun},
journal= {arXiv preprint arXiv:2404.12652},
year = {2025}
}
备注
Transactions on Machine Learning Research, 2025