量化与缓解 LLM 中的选择偏差:可迁移的 LoRA 微调与高效多数投票方法
计算与语言
2025-12-01 v1 人工智能
信息检索
摘要
多选题(MCQ)答题是评估大语言模型(LLM)性能的常用方法。然而,LLM 在 MCQ 任务中常表现出选择偏差,即其选择受答案位置或选项符号等因素影响,而非内容本身。这会削弱 MCQ 作为评估框架的可靠性。大多数现有选择偏差指标需要答案标签,并衡量预测分布与答案分布之间的偏差,但未能完全捕捉模型在不同答案排序下的预测一致性。现有的选择偏差缓解策略存在显著局限性:虽然多数投票方法有效,但计算成本高昂;校准方法需要验证集,往往难以在不同数据集上泛化。为弥补这些差距,我们提出了三个关键贡献:(1)一种新的无监督无标签的置换偏差指标(PBM),直接量化模型在答案置换下的预测不一致性,为更精确的选择偏差度量提供了可能;(2)一种高效的多数投票方法,称为批量问题上下文 KV 缓存(BaQCKV),显著降低计算成本,同时保持偏差缓解的有效性;(3)一种无监督的低秩适应(LoRA-1)微调策略,基于我们提出的指标和 BaQCKV,以缓解选择偏差,为具有计算效率和模型通用性的替代方案。跨多个 MCQ 基准的实验表明,我们的方法可降低偏差,提高准确性一致性,同时最小化计算成本。
引用
@article{arxiv.2511.21709,
title = {Quantifying and Mitigating Selection Bias in LLMs: A Transferable LoRA Fine-Tuning and Efficient Majority Voting Approach},
author = {Blessed Guda and Lawrence Francis and Gabrial Zencha Ashungafac and Carlee Joe-Wong and Moise Busogi},
journal= {arXiv preprint arXiv:2511.21709},
year = {2025}
}
备注
Accepted into IJCNLP-AACL 2026