自然语言生成自动评价指标中的社会偏见
计算与语言
2022-10-18 v1 人工智能
摘要
许多研究已揭示,词嵌入、语言模型以及 NLP 中特定下游任务的模型容易产生社会偏见,尤其是性别偏见。最近这些技术已逐渐应用于文本生成的自动评价指标。在本文中,我们提出一种基于词嵌入关联测试(WEAT)和句子嵌入关联测试(SEAT)的评价方法,以量化评价指标中的社会偏见,并发现社会偏见也广泛存在于一些基于模型的自动评价指标中。此外,我们构建了性别互换的元评价数据集,以探索图像描述和文本摘要任务中性别偏见的潜在影响。结果表明,在评价中给定性别中立的参考文本时,基于模型的评价指标可能表现出对男性假设(hypothesis)的偏好,并且它们的性能,即评价指标与人类判断之间的相关性,通常在性别互换后具有更显著的变化。
引用
@article{arxiv.2210.08859,
title = {Social Biases in Automatic Evaluation Metrics for NLG},
author = {Mingqi Gao and Xiaojun Wan},
journal= {arXiv preprint arXiv:2210.08859},
year = {2022}
}