中文

寻找答案:通过推理重新评估大语言模型的评估

计算与语言 2025-10-17 v1 人工智能

摘要

评估生成模型(如大语言模型,LLM)时,通常涉及问答任务,依据答案选项的概率进行最终答案选择。然而对于需要推理的模型,答案提取方法至关重要。我们的研究发现,推理模型及其最终答案分布对所采用的答案提取算法高度敏感。为缓解此问题,我们提出了一种基本框架:答案再生成。该方法通过额外的模型推理,提供以 "Answer:" 为前缀的 prior 输入和输出,最终答案从再生成的输出中选择或提取。我们表明,这种无需提取规则即可工作的方案表现出改进的性能和更好的鲁棒性。进一步,我们将此框架应用于一般数学问题和开放式问答任务。我们的分析和该框架可为模型评估提供更可靠的结果。

关键词

引用

@article{arxiv.2510.14773,
  title  = {Finding Answers in Thought Matters: Revisiting Evaluation on Large Language Models with Reasoning},
  author = {Hwiyeol Jo and Joosung Lee and Jaehone Lee and Sang-Woo Lee and Joonsuk Park and Kang Min Yoo},
  journal= {arXiv preprint arXiv:2510.14773},
  year   = {2025}
}

备注

ARR Submitted