为何基于提示的公平性指标不相关?
计算与语言
2024-06-11 v1 人工智能
计算机与社会
机器学习
摘要
大语言模型的广泛应用引发了关于这些模型可能学习的偏见的关键问题。这导致开发了多个旨在评估和缓解这些偏见的指标。本文首先演示了基于提示的公平性指标之间关联性差励,作为相关性衡量标准,这提出了关于使用提示进行公平性评估可靠性的重要问题。随后,我们概述了六个导致现有指标之间低相关性的相关原因。基于这些见解,我们提出一种称为 Correlated Fairness Output(CAIRO)的方法,以增强公平性指标之间的相关性。CAIRO 通过使用多个预训练语言模型扩展给定公平性指标的原始提示,然后选择实现指标之间最高相关性的提示组合。我们在性别和宗教偏见方面显示了从 0.3 和 0.18 提升至 0.90 和 0.98 的显著相关性提升。我们的代码已公开于 https://github.com/chandar-lab/CAIRO。
引用
@article{arxiv.2406.05918,
title = {Why Don't Prompt-Based Fairness Metrics Correlate?},
author = {Abdelrahman Zayed and Goncalo Mordido and Ioana Baldini and Sarath Chandar},
journal= {arXiv preprint arXiv:2406.05918},
year = {2024}
}
备注
In Proceedings of ACL main 2024