中文

指令梯度推理:面向可控语言模型的指令层级推理

计算与语言 2026-02-19 v4 人工智能

摘要

随着基于大语言模型(LLM)的系统在现实世界决策中承担高风险角色,必须在单个提示上下文中调和来自多个来源(如模型开发者、用户和工具)的竞争指令。因此,在LLM中强制执行指令层级(IH),使得高优先级指令覆盖低优先级请求,对于LLM的可靠性和可控性至关重要。本文将指令层级解决问题重新定义为推理任务。具体而言,模型必须在生成响应前先“思考”给定用户提示与高优先级(系统)指令之间的关系。在训练方面,我们构建VerIH数据集,包含约7000个对齐和冲突的系统-用户指令,用于可验证答案的约束跟随任务。我们表明,通过VerIH进行轻量级强化学习有效地将模型的通用推理能力转移到指令优先级。我们的微调模型在指令遵循和指令层级基准测试中实现持续改进,在IHEval冲突设置上大约提高20%。这种推理能力也适用于训练分布之外的安全关键场景。通过将安全问题视为对抗性用户输入与预定义高优先级策略之间的冲突解决,我们的训练模型对抗jailbreak和提示注入攻击具有更强鲁性,攻击成功率(ASR)降低最高可达20%。这些结果表明,指令层级推理为可靠的LLM提供了一条实用路径,其中对系统提示的更新可产生可控且稳健的模型行为变化。

关键词

引用

@article{arxiv.2511.04694,
  title  = {Reasoning Up the Instruction Ladder for Controllable Language Models},
  author = {Zishuo Zheng and Vidhisha Balachandran and Chan Young Park and Faeze Brahman and Sachin Kumar},
  journal= {arXiv preprint arXiv:2511.04694},
  year   = {2026}
}