中文

在 LLM 中认证反事实偏见

人工智能 2025-04-23 v3 机器学习

摘要

大型语言模型 (LLM) 可能产生偏见性响应,导致代表性伤害。然而,现有研究不足以全面评估不同人口统计学群体(即反事实偏见)下的 LLM 响应偏见,因为它们无法扩展到大量输入且不提供保证。因此,我们提出了第一个框架 LLMCert-B,用于对分布上的 LLM 进行反事实偏见认证。证书由对任何一组反事实提示(即因人口统计学群体不同而不同的提示,从分布中抽取)的无偏 LLM 响应概率的高置信区间组成。我们通过对由从提示分布中抽取的前缀构成的反事实提示分布,对给定提示集合演示了反事实偏见认证。我们考虑的前缀分布包括随机标记序列、人工越狱混合物以及 LLM 嵌入空间中对越狱的扰动。我们为 SOTA LLM 生成非平凡证书,暴露了这些模型在来自计算成本较低前缀分布生成的提示分布中的脆弱性。

关键词

引用

@article{arxiv.2405.18780,
  title  = {Certifying Counterfactual Bias in LLMs},
  author = {Isha Chaudhary and Qian Hu and Manoj Kumar and Morteza Ziyadi and Rahul Gupta and Gagandeep Singh},
  journal= {arXiv preprint arXiv:2405.18780},
  year   = {2025}
}

备注

Published at ICLR 2025