中文

原子指令差距:指令微调的 LLM 在简单自包含指令方面表现不佳

计算与语言 2025-10-21 v1

摘要

指令微调的大语言模型(IT-LLM)在零样本推理方面表现出强大能力,但其执行简单、自包含指令的能力尚未得到充分探索,尽管这一能力是复杂指令遵循的基础。我们在修改后的 MMLU 和 MMLU-Pro 基准测试上评估了 20 个 IT-LLM,通过系统性地变更选项标签格式(字母、数字、罗马数字)而保持其意义相同,同时遵循四种范式:(1)在明确指令的情况下,标签变更会导致显著的性能变化(例如,罗马数字与数字格式相比性能下降 30.45%),揭示了指令格式偏差。(2)在无指令的情况下,性能进一步下降(最高下降 10.84%),且标签敏感性加剧,凸显了明确指导的作用。(3)当选项内容被移除时,模型仅在数字标签情形下能通过随机选择基线,表明其对原子指令的遵循较弱。(4)三 shot 示例对鲁棒性和忠实度没有显著提升,生成分析显示持续的标签错误,尤其在非数字格式中尤为突出。跨模型大小来看,较大的 LLM 获得更高的准确率,但仍在指令遵循方面保持不一致。这些结果揭示了当前指令微调范式的不足,凸显了针对原子指令遵循需求的评估方法和训练策略的重要性。

关键词

引用

@article{arxiv.2510.17388,
  title  = {The Atomic Instruction Gap: Instruction-Tuned LLMs Struggle with Simple, Self-Contained Directives},
  author = {Henry Lim and Kwan Hui Lim},
  journal= {arXiv preprint arXiv:2510.17388},
  year   = {2025}
}

备注

11 pages, 1 figure, 8 tables