中文

指令调优模型在数学和领域迁移基准上的表现:实证分析

机器学习 2026-01-21 v1

摘要

指令微调是提高 LLM 性能的标准做法,但是否提升推理能力或仅诱导表面级模式匹配仍不清楚。我们通过在标准数学基准、结构扰动变体和领域迁移任务上评估基础模型和指令调优模型来研究此问题。我们的分析凸显了指令调优的两个关键(常被忽视的)局限性。第一,性能优势是不稳定的,取决于评估设置。在 GSM8K 的零样本 CoT 设置下,基础模型始终优于指令调优模型,性能下降可高达 32.67%(Llama3-70B)。只有在提供少量示例后,指令调优模型才会匹配或超越此性能,表明其依赖特定的提示模式而非内在推理能力。第二,在分布迁移下,调优收益脆弱。我们的结果显示,基础模型在特定领域的 MedCalc 基准上超越指令调优模型。此外,指令调优模型在扰动数据集上表现急剧下降,表明其对提示结构的敏感性高于对稳健推理的依赖。

关键词

引用

@article{arxiv.2601.13244,
  title  = {Do Instruction-Tuned Models Always Perform Better Than Base Models? Evidence from Math and Domain-Shifted Benchmarks},
  author = {Prateek Munjal and Clement Christophe and Ronnie Rajan and Praveenkumar Kanithi},
  journal= {arXiv preprint arXiv:2601.13244},
  year   = {2026}
}