中文

ImageCaptioner$^2$:用于图像描述偏倚放大评估的图像描述器

计算机视觉与模式识别 2023-06-07 v2 人工智能 机器学习

摘要

大多数预训练学习系统已知存在偏倚,通常源于数据、模型或两者兼有。度量和量化偏倚及其来源是一项具有挑战性的任务,并在图像描述中得到了广泛研究。尽管在此方向已有显著努力,我们观察到现有指标在视觉信号的纳入上缺乏一致性。在本文中,我们引入一种新的偏倚评估指标,称为ImageCaptioner2ImageCaptioner^2,用于图像描述。不同于度量模型或数据中的绝对偏倚,ImageCaptioner2ImageCaptioner^2更关注模型相对于数据偏倚所引入的偏倚,称为偏倚放大。与仅基于生成的描述来评估图像描述算法的现有方法不同,ImageCaptioner2ImageCaptioner^2在度量偏倚时纳入了图像。此外,我们设计了一种将生成描述的偏倚度量为基于提示的图像描述而非使用语言分类器的公式。最后,我们在三个不同数据集(即MS-COCO caption数据集、Artemis V1和Artemis V2)上,针对三个不同受保护属性(即性别、种族和情绪),将我们的ImageCaptioner2ImageCaptioner^2指标应用于11种不同的图像描述架构。相应地,我们通过提出AnonymousBench验证了ImageCaptioner2ImageCaptioner^2指标的有效性,AnonymousBench是一种用于偏倚指标的新型人工评估范式。我们的指标在人工对齐方面相比近期偏倚指标LIC表现出显著优越性,其中我们的指标和LIC的相关性分数分别为80%和54%。代码可在https://eslambakr.github.io/imagecaptioner2.github.io/获取。

关键词

引用

@article{arxiv.2304.04874,
  title  = {ImageCaptioner$^2$: Image Captioner for Image Captioning Bias Amplification Assessment},
  author = {Eslam Mohamed Bakr and Pengzhan Sun and Li Erran Li and Mohamed Elhoseiny},
  journal= {arXiv preprint arXiv:2304.04874},
  year   = {2023}
}