中文

关于大型语言模型在多项选择题回答中局限性的研究

计算与语言 2024-08-16 v2 人工智能 机器学习

摘要

大型语言模型 (LLMs) 的广泛采用已变得司空见惯,尤其是随着开源模型的出现。更重要的是,小型模型非常适合集成到消费级设备中,并经常作为独立解决方案或各种 AI 任务中的子程序被使用。尽管它们无处不在,但对其具体能力和局限性缺乏系统分析。在本研究中,我们 tackled 最广泛使用的任务之一——回答多项选择题 (MCQ)。我们分析了 26 个小型开源模型,发现 65% 的模型不理解该任务,只有 4 个模型能正确从给定选项中选择答案,且其中只有 5 个模型与选项顺序无关。鉴于这些模型在 MCQ 测试中的广泛使用,这些结果相当令人担忧。我们建议在任何领域使用 MCQ 评估 LLMs 之前,务必谨慎并测试其对任务的理解能力。

关键词

引用

@article{arxiv.2401.07955,
  title  = {A Study on Large Language Models' Limitations in Multiple-Choice Question Answering},
  author = {Aisha Khatun and Daniel G. Brown},
  journal= {arXiv preprint arXiv:2401.07955},
  year   = {2024}
}