B-score:基于响应历史检测大语言模型中的偏见
机器学习
2025-05-27 v1 计算与语言
摘要
大语言模型(LLMs)常表现出强烈的偏见,如对女性或对数字7持偏好态度。我们调查是否允许LLMs观察其对相同问题的先前回答后,能够输出较少偏见的答案。为理解哪些类型的问题更易引发偏见,我们测试LLMs在我们提出的覆盖9个主题并属于三类的问题集合上:(1)主观型;(2)随机型;(3)客观型。有趣的是的是,LLMs在多轮对话中能够针对寻求随机且无偏见答案的问题进行“去偏”。此外,我们提出B-score,这是一种有效检测主观、随机、易和难问题偏见的新指标。在MMLU、HLE和CSQA上,利用B-score显著提高了LLM答案验证准确率(即接受LLM正确答案、拒绝错误答案),相较于仅使用自信度评估或单轮回答频率。代码和数据可在 https://b-score.github.io 获取。
引用
@article{arxiv.2505.18545,
title = {B-score: Detecting biases in large language models using response history},
author = {An Vo and Mohammad Reza Taesiri and Daeyoung Kim and Anh Totti Nguyen},
journal= {arXiv preprint arXiv:2505.18545},
year = {2025}
}
备注
Accepted to ICML 2025 (Main track)