相对偏见:衡量 LLM 中偏见的比较框架
计算与语言
2025-05-26 v1 人工智能
机器学习
摘要
大型语言模型(LLM)的日益广泛部署加剧了关于其内在偏见的担忧,对公平性、安全性及社会影响提出了关键问题。然而,对 LLM 偏见进行量化仍是一个根本性挑战,这一挑战因“偏见”内涵的模糊性而加剧。随着新模型迅速涌现并广泛应用,同时引入尚未系统评估的潜在偏见。本文提出了相对偏见框架(Relative Bias framework),一种旨在评估 LLM 行为偏离特定目标领域内其他 LLM 行为的偏差方法。我们引入两种互补方法:(1)嵌入转换分析(Embedding Transformation analysis),通过嵌入空间中的句子表示捕捉相对偏见模式;(2)LLM 评判器(LLM-as-a-Judge),采用语言模型进行相对性评估。将 our 框架应用于偏见与对齐情景的多个案例研究后,通过统计检验进行验证,我们发现两种评分方法之间存在强烈的对齐,提供了一种系统、可扩展且在统计上有据可依的 LLM 相对偏见分析方法。
引用
@article{arxiv.2505.17131,
title = {Relative Bias: A Comparative Framework for Quantifying Bias in LLMs},
author = {Alireza Arbabi and Florian Kerschbaum},
journal= {arXiv preprint arXiv:2505.17131},
year = {2025}
}