锚定答案:揭示GPT-2多选题中的位置偏差
计算与语言
2025-06-03 v3 人工智能
机器学习
摘要
大型语言模型(LLMs),如GPT-4和LLaMA系列,在包括多选题(MCQs)在内的各种任务中取得了显著成功。然而,这些模型表现出位置偏差,尤其是在GPT-2系列中更严重的锚定偏差,即在推理过程中始终偏好MCQ中的第一个选项'A'。这种锚定偏差挑战了GPT-2决策过程的完整性,因为它基于选项位置而非内容扭曲了性能。在本研究中,我们利用机械可解释性方法识别GPT-2模型中导致此偏差的内部模块。我们聚焦于多层感知器(MLP)层和注意力头,使用“logit lens”方法追踪和修改导致偏差的特定值向量。通过更新MLP中的这些向量并重新校准注意力模式以消除对第一个选项'A'的偏好,我们有效缓解了锚定偏差。我们的干预不仅减轻了偏差,还提高了GPT-2系列在各种数据集上的整体MCQ预测准确性。这项工作首次对GPT-2模型MCQ失败案例中的锚定偏差进行了全面的机械分析,引入了有针对性的最小干预策略,显著增强了GPT-2模型在MCQ中的鲁棒性和准确性。我们的代码可在https://github.com/ruizheliUOA/Anchored_Bias_GPT2获取。
引用
@article{arxiv.2405.03205,
title = {Anchored Answers: Unravelling Positional Bias in GPT-2's Multiple-Choice Questions},
author = {Ruizhe Li and Yanjun Gao},
journal= {arXiv preprint arXiv:2405.03205},
year = {2025}
}
备注
ACL 2025 Findings