中文

BiasAlert:用于 LLM 社会偏见检测的即插即用工具

计算与语言 2024-07-23 v2

摘要

随着大型语言模型 (LLM) 的快速发展,对其偏见的评估变得越来越重要。然而,现有评估方法依赖固定格式的输出,无法适应 LLM 的灵活开放文本生成场景(例如句子完成和问答)。为此,我们引入 BiasAlert,一个用于检测 LLM 开放文本生成中的社会偏见的即插即用工具。BiasAlert 将外部人类知识与内在推理能力相结合,以可靠地检测偏见。广泛的实验表明,BiasAlert 在检测偏见方面显著优于如 GPT4-as-A-Judge 等现有最先进方法。此外,经过应用研究,我们展示了 BiasAlert 在可靠评估 LLM 偏见以及在 various 场景中进行偏见缓解中的实用性。该模型和代码将公开发布。

关键词

引用

@article{arxiv.2407.10241,
  title  = {BiasAlert: A Plug-and-play Tool for Social Bias Detection in LLMs},
  author = {Zhiting Fan and Ruizhe Chen and Ruiling Xu and Zuozhu Liu},
  journal= {arXiv preprint arXiv:2407.10241},
  year   = {2024}
}