语言偏置的图像分类:基于语义表示的评估
计算机视觉与模式识别
2022-03-15 v2 计算与语言
机器学习
摘要
人类对于词嵌入图像表现出语言偏置的图像识别,称为图词干扰。此类干扰依赖于层级语义类别,并反映人类语言处理与视觉处理高度交互。类似于人类,近期在文本和图像上联合训练的人工模型,例如 OpenAI CLIP,表现出语言偏置的图像分类。探究该偏置是否导致类似于人类观察到的干扰,有助于理解模型从语言和视觉联合学习中获取层级语义表示的程度。本研究引入认知科学文献中的方法工具来评估人工模型的偏置。具体而言,我们引入一个基准任务,以测试叠加在图像上的词是否能在不同类别层级扭曲图像分类,以及若可以,该扰动是否源于语言与视觉之间共享的语义表示。我们的数据集是一组词嵌入图像,由自然图像数据集与具有上位/基本类别层级的层级词标签混合构成。利用该基准测试,我们评估了 CLIP 模型。我们表明,呈现词会在不同类别层级扭曲模型的图像分类,但该效应不依赖于图像与嵌入词之间的语义关系。这表明 CLIP 视觉处理中的语义词表示并未与图像表示共享,尽管词表示在词嵌入图像中占强烈主导。
引用
@article{arxiv.2201.11014,
title = {Language-biased image classification: evaluation based on semantic representations},
author = {Yoann Lemesle and Masataka Sawayama and Guillermo Valle-Perez and Maxime Adolphe and Hélène Sauzéon and Pierre-Yves Oudeyer},
journal= {arXiv preprint arXiv:2201.11014},
year = {2022}
}
备注
Accepted at ICLR 2022