中文

通过Permutation-Aware GRPO消除大语言模型中的选择偏差

计算与语言 2026-05-01 v2 人工智能 机器学习

摘要

用于多选和两两评估任务的大语言模型(LLM)常因选项位置和标签符号等非语义因素而产生选择偏差。现有的推理时去偏方法成本高昂且可能损害推理,而基于点的数据训练则忽略了同一问题在不同置换下的应有一致答案。为此,我们提出Permutation-Aware Group Relative Policy Optimization(PA-GRPO),通过强制置换一致的语义推理来消除选择偏差。PA-GRPO为每个实例构建置换组,通过生成多个候选置换实现,采用两种互补机制进行优化:(1)跨置换优势,其计算相对于同一实例所有置换的平均奖励;(2)一致性感知奖励,该奖励鼓励模型在不同置换下产生一致决策。实验结果表明,PA-GRPO在七个基准测试中超越了强大的基线模型,显著降低选择偏差,同时保持高整体性能。代码已在GitHub上发布(https://github.com/ECNU-Text-Computing/PA-GRPO)。

关键词

引用

@article{arxiv.2603.21016,
  title  = {Mitigating Selection Bias in Large Language Models via Permutation-Aware GRPO},
  author = {Jinquan Zheng and Jia Yuan and Jiacheng Yao and Chenyang Gu and Pujun Zheng and Guoxiu He},
  journal= {arXiv preprint arXiv:2603.21016},
  year   = {2026}
}

备注

Accepted to ACL 2026 Main Conference. 19 pages, 3 figures, 6 tables