缓解大型语言模型中的标签长度偏差
计算与语言
2025-11-19 v1
摘要
大型语言模型(LLMs)是强大的零-shot 和 few-shot 学习者。然而,在对候选选项集合进行预测时,LLMs 会受到标签偏差的影响,而现有的校准方法忽略了来自多标记标签的偏差。我们解决了一个称为标签长度偏差的问题,即不同长度的标签在标准长度归一化后仍被不一致地处理。为缓解此问题,我们提出了归一化情境校准(NCC)方法,对完整标签级别的预测进行归一化和校准。NCC 在多个数据集和模型上均实现了显著的改进,F1 分数提升最高可达 10%。此外,NCC 将偏差缓解扩展到更广泛的任务,如多选题回答。我们的分析表明,与原语学习结合时,NCC 对 few-shot 示例选择不那么敏感,需要更少的示例即可实现竞争性能,并产生更可靠的置信度估计。这些发现凸显了在实际应用中尤其重要的是,由于类别标签自然由多个标记组成,缓解完整标签偏差对提高 LLM 方法的性能和鲁棒性具有重要意义。
关键词
引用
@article{arxiv.2511.14385,
title = {Mitigating Label Length Bias in Large Language Models},
author = {Mario Sanz-Guerrero and Katharina von der Wense},
journal= {arXiv preprint arXiv:2511.14385},
year = {2025}
}
备注
Accepted to AACL 2025 (Main)