中文

指令诱导冲突:大语言模型中的指令-行为冲突

计算与语言 2026-05-21 v1 人工智能

摘要

大语言模型被训练以遵循指令,但它们也是强大的模式完成器。在这两个目标发生冲突时会发生什么?我们构建了包含用户指令以特定方式行为(例如始终输出特定标记、以特定语言作答或采用特定人设)与 N 个硬编码助手步骤展示的竞争模式 P 的对话。随后我们衡量在该setting下对指令遵循 (IF) rates的表现,跨越 13 个模型和 16 种不同指令,最多可达 50 步。平均指令遵循率在不同模型之间范围从 1% 到 99%,与标准能力基准测试之间关联性很小。从指令遵循向模式遵循的转变是普遍的,但高度依赖于具体模型。鲁棒性受指令内容和输出格式的调制——当指令与模型训练的价值先验一致时,模型会更抵抗诱导;此外,多标记输出相对于单标记输出具有显著更大的抵抗力。链式思考推理可提升鲁棒性,但并未消除其易受诱导的脆弱性,并且可能在正确的推理与错误输出之间产生解离。当被要求预测在该setting下其行为时,模型在平均准确率达到 83.5%,但系统性地低估了自身对诱导压力的抵抗力。这些结果表明,即便是其他能力极强的模型,在诱导压力下也会出现指令遵循的脆弱性,而输出多样性而非对输入的语义性参与,是预测鲁棒性的主要因素。

关键词

引用

@article{arxiv.2605.20382,
  title  = {Do as I Say, Not as I Do: Instruction-Induction Conflict in LLMs},
  author = {Carolina Camassa and Derek Shiller},
  journal= {arXiv preprint arXiv:2605.20382},
  year   = {2026}
}

备注

31 pages