推理模型是测试利用者:重新思考多项选择
计算与语言
2025-10-03 v2
摘要
在问答领域评估大语言模型(LLMs)时,通常要求模型从一组固定选项中进行选择(即多项选择问答,MCQA)。尽管感兴趣的下游任务通常不会为系统提供明确的选项供其选择,但这种方法仍被广泛使用,因为它使自动评分变得简单直接,并且往往能产生与下游性能充分相关的具有挑战性的基准测试。本文研究了这一趋势对于最先进的推理模型是否仍然成立,系统性地评估了15个不同的问答基准(例如MMLU、GSM8K)和27个不同的LLMs(包括Qwen-2.5 7B等小型模型、Llama-3.3 70B等中型模型以及OpenAI的o3等大型最先进模型)。对于每个模型-基准对,我们考虑了5种向模型呈现问题的方式,包括是否向模型提供多项选择;是否有时用“以上都不是”替换正确答案;以及在呈现选项之前和/或之后,是否允许模型进行思维链推理。只要模型被允许仅在呈现必须选择的选项*之前*进行思维链推理,MCQA就仍然是模型下游性能的良好代理。另一方面,能够在获得一组选项*之后*进行推理的大型模型,由于利用了选项中的信息,其表现往往显著优于其自由文本性能。我们识别并量化了模型在回答MCQA问题时使用的信号,并提供了在分析MCQA结果时能更好反映LLMs真实推理能力的实用指南。
引用
@article{arxiv.2507.15337,
title = {Reasoning Models are Test Exploiters: Rethinking Multiple-Choice},
author = {Narun Raman and Taylor Lundy and Kevin Leyton-Brown},
journal= {arXiv preprint arXiv:2507.15337},
year = {2025}
}
备注
9 pages, 4 figures