测试时推理者是战略化的多选题解答者
计算与语言
2026-04-21 v2
摘要
大型语言模型(LLM)现在会在作答前进行推理,在诸如多选题解答(MCQA)等任务中表现出色。然而,一个关注点是LLM是否按预期解答MCQA,因为已有研究发现,未使用推理的LLM在MCQA中成功,且仅凭选项即可胜出,这种部分输入成功常与显而易见的捷径相关联,但推理痕迹可能揭示选项-only 策略是否真的浅薄。为考察这些策略,我们让进行推理的LLM分别以完整输入和选项-only 输入解答MCQA;测试时推理在完整输入和选项-only 输入中都提升了准确率,但后者仅为前者的一半。虽然可能归因于浅薄的捷径,但选项-only 成功几乎不受推理痕迹长度的影响,并且在发现推理痕迹通过忠诚性测试后,我们展示它们使用的是不那么有问题的策略,如推断缺失的题目。总体而言,我们挑战了部分输入成功总是缺陷的论点,因此我们提出如何利用推理痕迹来区分有问题的数据与较少有问题的推理。
引用
@article{arxiv.2510.07761,
title = {Test-Time Reasoners Are Strategic Multiple-Choice Test-Takers},
author = {Nishant Balepur and Atrey Desai and Rachel Rudinger},
journal= {arXiv preprint arXiv:2510.07761},
year = {2026}
}
备注
ACL 2026