中文

SUGARCREPE++ 数据集:视觉语言模型对语义与词汇变更的敏感性

计算机视觉与模式识别 2024-06-21 v2 计算与语言 机器学习

摘要

尽管大型语言模型(LLMs)在各类任务上取得了显著成功,包括视觉语言模型(VLMs)和单模态语言模型(ULMs),但它们仍未能准确理解精确的语义。例如,使用不同词汇构成但语义等价的句子,会导致模型产生不同的表征。这种差异的程度及其对编码语义的影响尚不清晰。本文提出了 SUGARCREPE++ 数据集,以分析 VLMs 和 ULMs 对词汇和语义变更的敏感性。SUGARCREPE++ 数据集中的每个样本包含一张图像及其对应的三组描述:一对在语义上等价但在词汇上不同的正面描述,以及一个硬负面描述。这构成了一种 3 分类语义(不)等价问题,挑战语言模型判断语义等价性。我们全面评估了各种 VLMs 和 ULMs,其架构、预训练目标和数据集差异显著。实验结果表明,VLMs 在区分词汇和语义变化方面仍存在困难,尤其是在对象属性和空间关系方面。尽管使用更大预训练数据集、更大模型规模以及多目标预训练的 VLMs 在 SUGARCREPE++ 上取得了更好表现,但仍有显著提升空间。我们进一步表明,所有在组合性数据集上表现较好的模型不一定在 SUGARCREPE++ 上同样表现出色,这凸显了仅靠组合性尚不足以理解语义与词汇变更的重要性。鉴于 SUGARCREPE++ 数据集所针对的属性在视觉语言社区中具有重要意义,它因此成为一种新的挑战。

关键词

引用

@article{arxiv.2406.11171,
  title  = {SUGARCREPE++ Dataset: Vision-Language Model Sensitivity to Semantic and Lexical Alterations},
  author = {Sri Harsha Dumpala and Aman Jaiswal and Chandramouli Sastry and Evangelos Milios and Sageev Oore and Hassan Sajjad},
  journal= {arXiv preprint arXiv:2406.11171},
  year   = {2024}
}

备注

Added the dataset link to the abstract