大型语言模型可能通过选择最不错误的选项来执行多项选择问答
计算与语言
2024-12-09 v3 人工智能
摘要
在自然语言处理(NLP)领域,大型语言模型(LLMs)在多种任务上的性能显著提升。然而,对 LLMs 的全面评估仍然是该领域不可避免的挑战。最近,采用多项选择问答(MCQA)作为评估 LLMs 的基准已获得广泛关注。然而,关于这种评估方法鲁棒性的担忧依然存在。基于先前关于“变异性”问题的讨论,我们揭示了另一个值得关注的维度:LLMs 可能通过选择最不错误的选项而非明显正确的选项来执行 MCQA。这一观察结果表明,LLMs 可能将多个选项视为正确,这可能会削弱 MCQA 作为评估 LLMs 指标的可靠性。为应对这一挑战,我们引入了一种增强的 MCQA 数据集增强方法,称为 MCQA+,以更准确地反映模型性能,从而凸显了在评估 LLM 能力时需要更精细评估机制的必要性。
引用
@article{arxiv.2402.01349,
title = {LLMs May Perform MCQA by Selecting the Least Incorrect Option},
author = {Haochun Wang and Sendong Zhao and Zewen Qiang and Nuwa Xi and Bing Qin and Ting Liu},
journal= {arXiv preprint arXiv:2402.01349},
year = {2024}
}
备注
COLING 2025