重新审视大型语言模型中基于提示的去偏
计算与语言
2025-03-13 v1
摘要
研究大型语言模型(LLM)中的偏见对于开发可信赖的 AI 至关重要。尽管通过提示工程进行基于提示的去偏十分常见,但其有效性依赖于模型能够固有地理解偏见这一假设。我们的研究使用 BBQ 和 StereoSet 基准,在开源模型和商业 GPT 模型上系统分析了这一假设。实验结果表明,基于提示的去偏往往流于表面;例如,尽管 Llama2-7B-Chat 模型在 BBQ 数据集上识别偏见问题达到了很高的准确率,但它却将超过 90% 的无偏见内容错误分类为有偏见。此外,偏见基准中特定的评估和问题设置通常会导致 LLM 选择“回避性答案”,从而忽略问题的核心以及响应与上下文的相关性。而且,以往方法表面上的成功可能源于有缺陷的评估指标。我们的研究凸显了基于提示的去偏工作中潜在的“虚假繁荣”,并强调需要重新审视偏见指标,以确保真正可信赖的 AI。
引用
@article{arxiv.2503.09219,
title = {Rethinking Prompt-based Debiasing in Large Language Models},
author = {Xinyi Yang and Runzhe Zhan and Derek F. Wong and Shu Yang and Junchao Wu and Lidia S. Chao},
journal= {arXiv preprint arXiv:2503.09219},
year = {2025}
}