基于分组抽象语义监督损失增强抽象表示的对比学习
计算与语言
2025-09-17 v1
摘要
人类能够将图像识别为一般概念的实例,而不仅仅是识别其中的物体及其关系。在本文中,我们研究了:1. 视觉语言模型(VLMs)在多大程度上具备这种概念抽象能力;2. 在图像中编码更高级概念信息的策略,以使生成的VLM模型(CLEAR GLASS模型)能在更大程度上具备这种能力。为此,我们引入了一个分组图像-文本数据集(MAGIC),该数据集由若干组图像描述组成,每组都有一组关联的图像和更高级别的概念标签。我们使用一种新颖的对比损失技术,促使模型在组内每个图像(文本)的表示中编码该图像-文本组所有成员共有的信息。我们的主要贡献是一个基于文本-图像对比组(外部对比损失)以及衡量组内图像-文本实例间距离的内部损失的分组对比损失函数。我们的训练方法使CLEAR GLASS模型的概念抽象能力成为一种涌现能力,因为模型并未接触到与每组关联的更高级别概念。相反,训练迫使模型为每个图像-文本组创建一个语义表示,使其在潜在语义空间中更接近更高级别概念的语义表示。我们的实验表明,与SOTA模型相比,这种训练方法使模型在抽象概念识别方面有所提升。
引用
@article{arxiv.2509.12771,
title = {Contrastive Learning with Enhanced Abstract Representations using Grouped Loss of Abstract Semantic Supervision},
author = {Omri Suissa and Muhiim Ali and Shengmai Chen and Yinuo Cai and Shekhar Pradhan},
journal= {arXiv preprint arXiv:2509.12771},
year = {2025}
}