大语言模型对多选题选项顺序的敏感性
计算与语言
2023-08-23 v1 人工智能
机器学习
摘要
大语言模型(LLMs)在各种自然语言处理(NLP)任务中展现出了卓越的能力。然而,先前的研究表明,这些模型对提示措辞、少样本示例及其顺序敏感,这对模型的公平评估提出了挑战。随着这些模型变得更加强大,理解和解决这些局限性变得势在必行。在本文中,我们关注 LLMs 在多选题任务上的鲁棒性——该任务常被用于研究 LLMs 的推理与事实检索能力。通过考察 LLMs 对多选题选项顺序的敏感性,我们展示了在不同基准上,即便在少样本设置中使用示例,当答案选项被重新排序时,LLMs 的性能差距可达约 13% 至 75%。通过详细分析,我们推测这种敏感性出现在 LLMs 对前 2/3 个选项之间的预测不确定时,并且由于位置偏差,特定选项的位置可能根据问题有利于这些顶部选项之间的某些预测。我们还识别了前 2 个选项中放大或缓解模型对选项位置偏差的模式。我们发现,对于放大偏差,最优策略是将前两个选项置于第一和最后位置。相反,为缓解偏差,我们建议将这些选项放在相邻位置。为验证我们的推测,我们进行了多种实验并采用两种方法来校准 LLMs 的预测,在不同模型和基准上带来了高达 8 个百分点的提升。
引用
@article{arxiv.2308.11483,
title = {Large Language Models Sensitivity to The Order of Options in Multiple-Choice Questions},
author = {Pouya Pezeshkpour and Estevam Hruschka},
journal= {arXiv preprint arXiv:2308.11483},
year = {2023}
}