中文

面向 LLM 公平性的原位行为评估,而非标准化测试分数

计算与语言 2026-05-14 v1 人工智能 计算机与社会

摘要

大语言模型(LLM)的公平性应通过原位对话行为进行评估,而非依赖标准化测试 Q&A 基准。我们表明,标准化测试范式存在结构性不可靠性:表层级的提示构建选择虽与所测试的公平性问题完全无关,却解释了大部分得分变异,导致公平性结论在方向和幅度上都发生偏移,并引发严重的模型排名不一致。我们发展了 MAC-Fairness,一个多智能体对话框架,将受控变体嵌入多轮对话,以进行原位行为评估,考察模型在身份变化的情况下如何在自然多智能体互动中影响其对话行为。将标准化测试问题转化为对话种子,而非作为评估工具,我们评估了位置稳定性(即从自我视角保持立场的方式)和同行接受度(即从他人视角衡量其对同行的接受程度),基于跨多个模型和身份存在配置的 800 万篇对话稿。原位行为评估揭示了稳定的、模型特有的行为特征,这些特征可在不同公平性目标和评估方法的基准之间通用,表明这类证据是标准化测试范式所不提供的。

关键词

引用

@article{arxiv.2605.12530,
  title  = {In-Situ Behavioral Evaluation for LLM Fairness, Not Standardized-Test Scores},
  author = {Zeyu Tang and Sang T. Truong and Deonna Owens and Shreyas Sharma and Yibo Jacky Zhang and Brando Miranda and Sanmi Koyejo},
  journal= {arXiv preprint arXiv:2605.12530},
  year   = {2026}
}