中文

无他人:区分LLM评估基准中推理与记忆的通用技术

计算与语言 2026-03-30 v5

摘要

在LLM评估中,推理常通过对数学类问题进行数值变换来区分于记忆/回忆。我们引入一种用于多选题的通用变方法,完全将正确答案与先前出现的标记或概念区分开来,需要LLMs理解和推理才能正确作答。使用该方法,我们在两个语言可用的数据集(英语和西班牙语)上评估了最先进的专有和开源LLMs:公开的MMLU基准测试和私人的UNED-Access 2024数据集。结果显示,所有模型在我们提出的变方法下都经历了显著的准确率下降,在MMLU上平均损失57%,在UNED-Access 2024上损失50%,跨模型损失范围从10%到93%。值得注意的是,我们实验中最准确的模型(OpenAI-o3-mini)并非最稳健的模型(DeepSeek-R1-70B),这表明在标准评估中的最佳模型并不一定是推理能力更好的模型。我们还看到公共(相对于私有)数据集和以其原语言(相对于手动翻译)提出的问题会导致更大的准确率下降,这是污染和记忆/回忆在当前LLM答案中发挥作用的迹象,也指向了记忆/回忆在当前LLM答案中发挥重要作用的一个相关因素。

关键词

引用

@article{arxiv.2502.12896,
  title  = {None of the Others: a General Technique to Distinguish Reasoning from Memorization in Multiple-Choice LLM Evaluation Benchmarks},
  author = {Eva Sánchez Salido and Julio Gonzalo and Guillermo Marco},
  journal= {arXiv preprint arXiv:2502.12896},
  year   = {2026}
}