通过直接偏好优化消除 LLM 对虚构社交情境的偏见
人工智能
2026-04-17 v2 计算与语言
摘要
LLM 正在被广泛用于高风险决策,但其对虚构情境信息的敏感性可能引入有害偏见。这在模型被用于评估教师教学质量时尤为关切,因为偏见的评估会影响教师的职业发展和职业生涯。我们使用最大公开可得的美国课堂 transcript 数据集 (NCTE) 配合专家评分标准,研究模型对虚构社交情境的鲁棒性。我们评估了七个前沿和开源权重模型在七类虚构情境中的表现——包括教师经验、教育水平、人口统计学身份以及引导性 sycophancy 框架——发现无关情境信息可使模型预测在 7 分尺度上偏移最高达 1.48 分,尽管更大模型有时表现出更大的敏感性尽管预测准确率更高。使用提示词和标准直接偏好优化 (DPO) 的缓解措施大多不够。我们提出 **Debiasing-DPO**,这是一种自监督训练方法,将仅由查询生成的中性推理与额外虚构情境上下文生成的模型偏见推理配对。我们进一步将该目标与针对真实标签的监督微调相结合,以防止预测准确性下降。应用于 Llama 3B 与 8B 和 Qwen 3B 与 7B Instruct 模型时,Debiasing-DPO 将偏见降低 84%,平均提高预测准确性 52%。我们的发现表明,虚构情境的鲁棒性并非模型规模的自然副产品,我们的 proposed 方法可为基于提示的预测任务在准确性和鲁棒性方面实现显著提升。
引用
@article{arxiv.2604.02585,
title = {Mitigating LLM biases toward spurious social contexts using direct preference optimization},
author = {Hyunji Nam and Dorottya Demszky},
journal= {arXiv preprint arXiv:2604.02585},
year = {2026}
}
备注
26 pages