中文

BiasGuard:面向大语言模型的基于推理增强的偏见检测工具

计算与语言 2025-06-11 v2

摘要

识别 LLM 生成内容中的偏见是确保 LLM 公平性的关键前提。现有方法,如公平性分类器和 LLM 评判器,因难以理解底层意图以及缺乏公平性判断标准而受到限制。本文介绍了 BiasGuard,一种新颖的偏见检测工具,通过显式分析输入并依据公平性规范进行推理,以提供准确判断。BiasGuard 通过两个阶段实现:第一个阶段初始化模型以基于公平性规范进行推理,第二个阶段则利用强化学习来增强其推理和判断能力。我们在五个数据集上进行的实验表明,BiasGuard 超越了现有工具,提高了准确性并减少了过度公平误判。我们还强调了基于推理的决策-making 的重要性,并为我们两阶段优化管道的有效性提供了证据。

关键词

引用

@article{arxiv.2504.21299,
  title  = {BiasGuard: A Reasoning-enhanced Bias Detection Tool For Large Language Models},
  author = {Zhiting Fan and Ruizhe Chen and Zuozhu Liu},
  journal= {arXiv preprint arXiv:2504.21299},
  year   = {2025}
}

备注

ACL 2025 findings