图像描述自动评测指标中的性别偏见
计算与语言
2023-11-06 v3
摘要
基于模型的评测指标(如 CLIPScore 与 GPTScore)在各种语言生成任务中已展现出与人类判断的较好相关性。然而,其对公平性的影响仍很大程度上未被探索。众所周知,预训练模型可能无意中编码社会偏见,因此将这些模型用于评测目的可能无意中延续并放大偏见。例如,即便图像中仅显示男性会计师,某一评测指标也可能偏好描述“一名女性正在计算账本”而非“一名男性正在计算账本”的句子。本文中,我们对图像描述任务中基于模型的自动评测指标的性别偏见进行了系统研究。我们首先整理了一个包含与刻板性别关联的职业、活动与物体概念的数据集。随后,我们展示了使用这些有偏指标的负面后果,包括无法区分有偏与无偏生成,以及通过强化学习将偏见传播至生成模型。最后,我们提出了一种简单有效的方法以缓解指标偏见,且不损害其与人类判断的相关性。我们的数据集与框架为理解基于模型的评测指标的潜在危害奠定了基础,并有助于未来工作开发更具包容性的评测指标。
引用
@article{arxiv.2305.14711,
title = {Gender Biases in Automatic Evaluation Metrics for Image Captioning},
author = {Haoyi Qiu and Zi-Yi Dou and Tianlu Wang and Asli Celikyilmaz and Nanyun Peng},
journal= {arXiv preprint arXiv:2305.14711},
year = {2023}
}
备注
Accepted to EMNLP 2023