中文

一步之遥:指令调优帮助性的脆弱性

计算与语言 2026-04-28 v2 人工智能

摘要

指令调优的大型语言模型会产生有帮助且结构化的响应,但在面对简单约束时,这种帮助性如何稳健?我们展示,简单的词汇约束(禁止单个标点字符或常见单词)会导致指令调优的LLM崩溃其响应,在七个跨越五个模型家族(7B至70B,开放权重与封闭权重)的模型中,综合性损失可达14%至48%。一个盲测人类评估与10名接受STEM训练的评估员确认,这是真实的内容损失,信息准则的性能下降比表面准则高出1.5至2.3倍,由4100多对自动成对比较得到证实(77%至100%的基线偏好),涉及来自两个模型家族的三个LLM评估员。诊断分析识别出这是一种“计划失败”:两遍生成在59%至96%的响应长度恢复,线性探针在生成开始前对提示表示的预测响应长度可达R2=0.51R^2 = 0.51至0.94。相同探针在基础模型上得出负R2R^2,确认指令调优引入支撑崩溃的表示结构。基础模型在相同约束下无系统性退化,表明指令调优将任务能力与狭窄的表面形式模板相耦合。该效应延及现实部署约束(前言抑制、公司语气指南、法律合规含糊、可访问性要求),导致可观的退化(-2222%至-3434%),仅抑制对话开场词(“当然!”)即可导致我们最脆弱模型上的40%崩溃,尽管仅限制了开头的token。我们进一步展示,标准的独立LLM评估器仅检测到3.5%的质量下降,而成对评估揭示了23%的质量下降,暴露了当前评估实践中的方法论盲点。

关键词

引用

@article{arxiv.2604.13006,
  title  = {One Token Away from Collapse: The Fragility of Instruction-Tuned Helpfulness},
  author = {Erfan Baghaei Potraghloo and Seyedarmin Azizi and Souvik Kundu and Massoud Pedram},
  journal= {arXiv preprint arXiv:2604.13006},
  year   = {2026}
}