HALF:面向部署的LLM公平性评估框架
计算与语言
2025-10-17 v2 人工智能
摘要
大型语言模型(LLM)正在跨越临床决策支持、法律分析、招聘和教育等高影响力领域部署,使公平性和偏差评估在部署前变得至关重要。然而,现有评估缺乏现实场景的 grounding,且未考虑不同危害严重程度的差异,例如手术中的偏见决策不应与文本概括中的风格偏见等同衡量。为此,我们引入HALF(Harm-Aware LLM Fairness),一个面向部署的框架,对模型在真实应用中的偏差进行评估,并依据危害严重程度对结果进行加权。HALF将九个应用领域分为三个层级(严重、适度、轻微),并采用五阶段管道。我们在八个LLM上的评估结果显示:(1)LLM在不同领域公平性不一致,(2)模型规模或性能并不保证公平性,(3)推理模型在医疗决策支持中表现更好,但在教育领域表现更差。我们得出结论,HALF暴露了以往基准测试成功与部署就绪性之间的明显差距。
引用
@article{arxiv.2510.12217,
title = {HALF: Harm-Aware LLM Fairness Evaluation Aligned with Deployment},
author = {Ali Mekky and Omar El Herraoui and Preslav Nakov and Yuxia Wang},
journal= {arXiv preprint arXiv:2510.12217},
year = {2025}
}