面向大语言模型的无手动测试集偏差评估:基于概念表示的视角
计算与语言
2025-05-22 v1 人工智能
摘要
大型语言模型 (Large Language Model, LLM) 中的偏差显著削弱了其可靠性和公平性。我们关注一种常见的偏差形式:当模型概念空间中的两个参考概念(例如情感极性,如“积极”和“消极”)与第三个目标概念(如评价方面)存在不对称的相关性时,模型会表现出意图外的偏差。例如,“食物”的理解不应倾向于任何特定的情感。现有的偏差评估方法通过构建不同社交群体的标记数据来评估 LLM 的行为差异,并衡量其在不同群体中的响应,这一过程需要大量的人力工作,且仅捕捉有限的社交概念。为克服这些限制,我们提出了 BiasLens,一个基于模型向量空间结构的测试集无偏差分析框架。BiasLens 将概念激活向量 (Concept Activation Vectors, CAVs) 与稀疏自编码器 (Sparse Autoencoders, SAEs) 结合,以提取可解释的概念表示,并通过衡量目标概念与每个参考概念之间的表示相似性变化来量化偏差。即使没有标记数据,BiasLens 也与传统偏差评估指标高度一致(斯佩尔曼相关系数 r > 0.85)。此外,BiasLens 揭示了使用现有方法难以检测的偏差形式。例如,在模拟的临床场景中,患者的保险状态可能导致 LLM 生成偏差的诊断评估。总体而言,BiasLens 提供了一种可扩展、可解释且高效的偏差发现范式,为改进 LLM 的公平性和透明度指明了方向。
引用
@article{arxiv.2505.15524,
title = {Evaluate Bias without Manual Test Sets: A Concept Representation Perspective for LLMs},
author = {Lang Gao and Kaiyang Wan and Wei Liu and Chenxi Wang and Zirui Song and Zixiang Xu and Yanbo Wang and Veselin Stoyanov and Xiuying Chen},
journal= {arXiv preprint arXiv:2505.15524},
year = {2025}
}