ReTraceQA:评估小语言模型在常识问答中的推理轨迹
计算与语言
2026-04-21 v2
摘要
虽然小语言模型(SLMs)在日益广泛的常识推理基准上展现了有前景的性能,但当前的评估实践几乎完全依赖于其最终答案的准确性,忽视了导致这些答案的推理过程的有效性。为解决这一问题,我们提出了ReTraceQA,一种引入过程级评估的常识推理任务新基准。我们的人工标注数据集揭示,在大量实例中(14-24%),SLMs尽管推理过程存在缺陷但仍提供了正确的最终答案,这表明仅通过将最终答案与真实答案进行比较来评估SLM的能力往往被高估。事实上,我们表明,当采用强的大语言模型(LLMs)作为推理感知评估的自动裁判而非仅基于答案的指标时,SLM在所有模型和数据集上的性能显著下降,分数降低高达25%。
引用
@article{arxiv.2510.09351,
title = {ReTraceQA: Evaluating Reasoning Traces of Small Language Models in Commonsense Question Answering},
author = {Francesco Maria Molfese and Luca Moroni and Ciro Porcaro and Simone Conia and Roberto Navigli},
journal= {arXiv preprint arXiv:2510.09351},
year = {2026}
}
备注
Accepted at ACL 2026 Main Conference