中文

提示公平性:整合因果关系以消除大型语言模型偏见

计算与语言 2025-03-04 v2 人工智能 机器学习

摘要

大型语言模型(LLM)尽管能力卓越,却容易产生有偏见和歧视性的回应。随着LLM日益影响高风险决策(例如招聘和医疗保健),减轻这些偏见变得至关重要。在这项工作中,我们提出了一个因果关系引导的去偏框架来应对社会偏见,旨在减少LLM决策与输入中社会信息之间的不良依赖。我们的框架引入了一个新颖的视角,通过不同的因果路径识别社会信息如何影响LLM的决策。利用这些因果洞见,我们概述了通过选择机制调节这些路径的原则性提示策略。该框架不仅统一了现有的基于提示的去偏技术,还通过鼓励模型优先考虑基于事实的推理而非依赖有偏见的社会线索,为减少偏见开辟了新方向。我们通过在多个领域的真实世界数据集上进行广泛实验来验证我们的框架,证明了其在消除LLM决策偏见方面的有效性,即使仅能黑盒访问模型。

关键词

引用

@article{arxiv.2403.08743,
  title  = {Prompting Fairness: Integrating Causality to Debias Large Language Models},
  author = {Jingling Li and Zeyu Tang and Xiaoyu Liu and Peter Spirtes and Kun Zhang and Liu Leqi and Yang Liu},
  journal= {arXiv preprint arXiv:2403.08743},
  year   = {2025}
}

备注

24 pages, 10 figures