主流偏差指标是否能捕捉大语言模型的分配性伤害?
计算与语言
2026-03-09 v2 计算机与社会
摘要
分配性伤害发生在资源或机会被不公平地剥夺给特定群体时。许多提出的偏差衡量指标忽略了预测结果与实际决策之间的差异——后者是所提议方法所考虑的,而决策是基于这些预测作出的。我们的工作检验当前偏差指标在评估大型语言模型(LLM)预测引起的分配性伤害的可靠性。我们评估其在十个LLM和两个分配任务中的预测有效性和模型选择实用性。我们的结果表明,基于平均性能差距和分布距离的常用偏差指标,不能可靠地捕捉到分配结果中群体间的不平等。我们的工作凸显了需考虑模型预测如何被用于决策的重要性,尤其是在资源有限且受此影响的情境中。
引用
@article{arxiv.2408.01285,
title = {Do Prevalent Bias Metrics Capture Allocational Harms from LLMs?},
author = {Hannah Cyberey and Yangfeng Ji and David Evans},
journal= {arXiv preprint arXiv:2408.01285},
year = {2026}
}
备注
Accepted to Workshop on Insights from Negative Results in NLP (2025)