BiAxisAudit: 一种评估 LLM 在提示灵敏性和响应层偏差方面的新框架
计算与语言
2026-05-12 v1 密码学与安全
摘要
大语言模型的偏差审计现已进入治理框架(如欧盟 AI 法案),使得基准测试的可靠性本身成为安全问题。然而,许多当前基准测试却将偏差简化为单个标量,仅基于一种提示格式和一种表面标签。这种设计会遗漏两种在不改变模型权重的情况下即可被利用的失效模式。我们发现,跨提示的、在意义上保持一致的格式变化会使偏差 endorsement 超过 0.7。在单个响应内部,离散的“选择”和自由文本“阐述”可能持有相反的立场,以致看似干净的聚合结果可能隐藏实质性的内部不一致(如“抵消陷阱”)。因此,仅基于选择的评分与仅基于阐述的排名在八个 LLM 之间几乎不相关(Spearman ρ = 0.238, p = 0.570):LLaMA3-70B 在仅选择评分时排名居中,但在仅基于阐述评分时排名最高。我们引入了 BiAxisAudit 框架,该框架在两个正交轴上报告每个偏差分数及其可靠性估计。跨提示轴在任务格式、视角、角色和情感等因子网格下评估每个陈述,将偏差视为分布而非点估计。响应内轴采用 Split Coding 方法分离恢复选择与阐述作为独立信号,通过不一致率(Inconsistency Rate)和发散净不平衡(Divergence Net Imbalance)进行衡量。在对八个 LLM、每个模型 80,200 条编码响应进行分析后发现,任务格式alone 解释了与模型选择等同的方差;63.6% 的合并偏差信号(最高可达 85.2%)仅出现在一个编码层中,提示维度的交互作用超过主效应。该仪器还能区分真实的偏差减少与由跨层重新分配导致的表观减少:某些提示配置可同时降低 BER 和 IR,而另一些仅抑制选择层的偏差。
引用
@article{arxiv.2605.09041,
title = {BiAxisAudit: A Novel Framework to Evaluate LLM Bias Across Prompt Sensitivity and Response-Layer Divergence},
author = {Jialing Gan and Junhao Dong and Songze Li},
journal= {arXiv preprint arXiv:2605.09041},
year = {2026}
}
备注
24 pages, 10 figures. Preprint