伪影还是溯因:大语言模型如何在没有题干的情况下回答多项选择题?
计算与语言
2024-06-11 v2
摘要
多项选择题(MCQA)常被用于评估大语言模型(LLM)。为了检验 MCQA 是否按预期评估了 LLM,我们探究了 LLM 能否在仅提供选项的提示下完成 MCQA 任务,即模型必须仅从选项中选出正确答案。在三个 MCQA 数据集和四个 LLM 上的实验显示,该提示方式在 12 种情况中有 11 种优于多数基线,准确率提升高达 0.33。为解释这一现象,我们对记忆化、选项动态和题干推断进行了深入的黑盒分析。我们的主要发现有三点:首先,未发现仅选项准确率源于单纯记忆化的证据;其次,对单个选项的先验概率不能完全解释仅选项准确率,暗示 LLM 利用了选项间的群体动态;第三,LLM 具备一定的从选项推断相关题干的能力,令人惊讶的是,有时甚至能匹配原始题干。推断原始题干是一种令人印象深刻的推理策略,但无法完全解释 LLM 在 MCQA 中较高的仅选项准确率。因此,虽然 LLM 并非完全不具备在 MCQA 中进行推理的能力,我们仍主张在 MCQA 基准测试中使用更强的基线,设计鲁棒的 MCQA 数据集以实现公平评估,并进一步努力解释 LLM 的决策机制。
引用
@article{arxiv.2402.12483,
title = {Artifacts or Abduction: How Do LLMs Answer Multiple-Choice Questions Without the Question?},
author = {Nishant Balepur and Abhilasha Ravichander and Rachel Rudinger},
journal= {arXiv preprint arXiv:2402.12483},
year = {2024}
}
备注
ACL 2024