BiasGuard:面向大语言模型的基于推理增强的偏见检测工具
计算与语言
2025-06-11 v2
摘要
识别 LLM 生成内容中的偏见是确保 LLM 公平性的关键前提。现有方法,如公平性分类器和 LLM 评判器,因难以理解底层意图以及缺乏公平性判断标准而受到限制。本文介绍了 BiasGuard,一种新颖的偏见检测工具,通过显式分析输入并依据公平性规范进行推理,以提供准确判断。BiasGuard 通过两个阶段实现:第一个阶段初始化模型以基于公平性规范进行推理,第二个阶段则利用强化学习来增强其推理和判断能力。我们在五个数据集上进行的实验表明,BiasGuard 超越了现有工具,提高了准确性并减少了过度公平误判。我们还强调了基于推理的决策-making 的重要性,并为我们两阶段优化管道的有效性提供了证据。
引用
@article{arxiv.2504.21299,
title = {BiasGuard: A Reasoning-enhanced Bias Detection Tool For Large Language Models},
author = {Zhiting Fan and Ruizhe Chen and Zuozhu Liu},
journal= {arXiv preprint arXiv:2504.21299},
year = {2025}
}
备注
ACL 2025 findings