超越标记:LLM 公平性的语义与统计量化
计算与语言
2025-10-13 v5 人工智能
计算机与社会
摘要
大型语言模型(LLM)常常生成带有内在偏见的响应,这削弱了其在实际应用中的可靠性。现有评估方法往往忽视长形式响应中的偏见以及 LLM 输出的内在变异性。为此,我们提出了 FiSCo(Fine-grained Semantic Comparison),这是一种新型统计框架,用于通过检测跨人口统计学分组中长形式响应中细微语义差异来评估 LLM 的组级公平性。与专注于情感或标记级比较的先前工作不同,FiSCo 通过在主张层面上运行,利用蕴涵检查来评估跨响应意义一致性,从而超越表面层面的分析。我们将模型输出分解为语义上具有区别性的主张,并应用统计假设检验来比较组间和组内相似性,从而实现对细微偏见的稳健检测。我们正式定义了一种新的组计数公平性,并在覆盖性别、种族和年龄的合成数据和人工标注数据集上对 FiSCo 进行了验证。实验表明,FiSCo 能够更可靠地识别细微偏见,同时减少 LLM 随机变异性的影响,优于各种评估指标。
引用
@article{arxiv.2506.19028,
title = {Quantifying Fairness in LLMs Beyond Tokens: A Semantic and Statistical Perspective},
author = {Weijie Xu and Yiwen Wang and Chi Xue and Xiangkun Hu and Xi Fang and Guimin Dong and Chandan K. Reddy},
journal= {arXiv preprint arXiv:2506.19028},
year = {2025}
}
备注
29 pages, 9 figures, 15 tables