中文

多选择题是否真的能用于检测大语言模型的能力?

计算与语言 2024-05-24 v3

摘要

多选择题(multiple-choice questions,MCQs)因其简单高效,被广泛用于大语言模型(large language models,LLMs)的评估。然而,关于MCQs是否真正衡量LLM能力,特别是在需要长形式生成(long-form generation,LFG)答案的知识密集型场景中,亦存在顾虑。对评估方法与任务之间的错位要求进行深思熟虑的分析,而我们在本文中通过在中英文四个问答(question-answering,QA)数据集上评估九个LLM来完成这一分析。我们识别出一个显著问题:LLM在双语MCQs中表现出顺序敏感性,偏好特定位置的答案,即第一个位置。我们进一步通过比较其直接输出、标记概率(token logits)和嵌入向量来量化MCQs与长形式生成问题(long-form generation questions,LFGQs)之间的差距。我们的结果显示,针对相同问题的MCQs答案与LFGQ答案之间存在较低的相关性。此外,我们提出了两种方法来量化LLM输出的一致性和置信水平,这些方法可推广至其他QA评估基准。值得注意的是,我们的分析挑战了'一致性越高,准确性越高'的观念。我们还发现MCQs在预期校准误差(expected calibration error)方面不如LFGQs可靠。MCQs与LFGQs之间的错位不仅体现在评估性能上,也体现在嵌入空间中。我们的代码和模型可在 https://github.com/Meetyou-AI-Lab/Can-MC-Evaluate-LLMs 访问。

关键词

引用

@article{arxiv.2403.17752,
  title  = {Can multiple-choice questions really be useful in detecting the abilities of LLMs?},
  author = {Wangyue Li and Liangzhi Li and Tong Xiang and Xiao Liu and Wei Deng and Noa Garcia},
  journal= {arXiv preprint arXiv:2403.17752},
  year   = {2024}
}

备注

LREC-COLING 2024