DeFrame:去除大语言模型关于框架效应的偏见
计算与语言
2026-02-05 v1 人工智能
摘要
随着大型语言模型(LLM)在实际应用中的部署增加,确保其在人口统计学方面的公平性已成为关键。尽管已有许多努力,但持续面临的挑战是隐藏偏见:LLM 在标准评估下看似公平,但在这些评估setting 之外可能产生偏见响应。本文识别出框架效应——即对等语义提示的不同表达方式(例如,"A 比 B 更好" vs. "B 比 A 更差")——作为这一差距的未被充分探索的贡献者。我们首先引入"框架不平等"概念,用于量化框架对公平性评估的影响。通过在公平性评估基准中加入替代性框架,我们发现(1)框架得分在框架变化时显著变化,(2)现有的去偏方法提高了整体(即框架平均)公平性,但常常未能减少由框架引起的不平等。为此,我们提出一种框架感知去偏方法,该方法鼓励 LLM 在不同框架下更具一致性。实验表明,我们的方法既减少了总体偏见,又提高了对框架不平等的鲁棒性,使 LLM 能够产生更公平且更一致的响应。
引用
@article{arxiv.2602.04306,
title = {DeFrame: Debiasing Large Language Models Against Framing Effects},
author = {Kahee Lim and Soyeon Kim and Steven Euijong Whang},
journal= {arXiv preprint arXiv:2602.04306},
year = {2026}
}
备注
40 pages, 12 figures