中文

在多模态语言模型评测中控制刻板印象

计算与语言 2023-02-06 v1

摘要

我们提出一种方法论并设计两组基准集,用于衡量语言-视觉语言模型在存在或不存在刻板印象时利用视觉信号的程度。第一个基准用于测试常见物体的刻板颜色,第二个基准考虑性别刻板印象。其核心思想是将图像符合刻板印象时的预测与不符合时的预测进行比较。我们的结果显示多模态模型间存在显著差别:基于Transformer的最新模型FLAVA似乎比基于CNN的旧模型(如VisualBERT和LXMERT)对图像选择更敏感,且受刻板印象影响更小。这种效应在此类受控设定下比在传统评测中更可辨别,因为在传统评测中我们不知道模型是依赖刻板印象还是视觉信号。

关键词

引用

@article{arxiv.2302.01582,
  title  = {Controlling for Stereotypes in Multimodal Language Model Evaluation},
  author = {Manuj Malik and Richard Johansson},
  journal= {arXiv preprint arXiv:2302.01582},
  year   = {2023}
}