中文

BiasLab:用于衡量大型语言模型输出级偏见的多语言、双框架框架

计算与语言 2026-01-13 v1 人工智能

摘要

大型语言模型(LLM)正在被部署到影响实际决策的高风险场景中。然而,评估LLM输出的偏见仍具有方法学挑战,due to对提示措辞的敏感性、有限的多语言覆盖以及缺乏能够实现跨模型可靠比较的标准化指标。本文介绍BiasLab,一个开源、模型无关的评估框架,用于通过多语言、面向鲁棒性的实验设计量化输出级(外在)偏见。BiasLab构建严格的双框架方案的镜像探�子对:一个肯定的断言支持目标A,通过确定性目标替换获得反向断言支持目标B,同时保持相同的语言结构。为减少对提示模板的依赖,BiasLab在随机化指令包装器下进行重复评估,并强制执行固定选择的Likert响应格式以最大化跨模型和跨语言的可比性。响应被规范化为一致标签,使用LLM-based仲裁进行 polarity一致性对齐,并聚合为定性偏见指标,包括效应大小和中性率等描述性统计。该框架支持跨多种偏见轴的评估,包括人口统计学、文化、政治和地缘政治主题,并产生可重复的制品,如结构化报告和比较可视化。BiasLab为跨语言和框架敏感性偏见测量提供了标准化方法,补充了内在方法和数据集基础的审计,使研究人员和机构能够对鲁棒性进行基准测试并做出更明智的部署决策。

关键词

引用

@article{arxiv.2601.06861,
  title  = {BiasLab: A Multilingual, Dual-Framing Framework for Robust Measurement of Output-Level Bias in Large Language Models},
  author = {William Guey and Wei Zhang and Pei-Luen Patrick Rau and Pierrick Bougault and Vitor D. de Moura and Bertan Ucar and Jose O. Gomes},
  journal= {arXiv preprint arXiv:2601.06861},
  year   = {2026}
}

备注

source code and reproducibility scripts available on GitHub