中文

层次对齐:通过逻辑一致性在大语言模型中强制执行层次指令

计算与语言 2026-04-13 v1

摘要

大型语言模型 increasingly 在来自异构来源(包括系统策略、用户请求、工具输出和检索上下文)的多个指令下运行,这些指令具有不同的权威级别。虽然先前关于指令层次的工作强调尊重指令优先级的重要性,但主要关注对抗性攻击,忽略了在实际应用中常见的良性指令冲突。在此类设置下,模型不仅要避免安全违规,还要在指令部分或隐式冲突时保持任务实用性和行为一致性。我们提出了神经符号层次对齐 (NSHA) 用于层次指令遵循,通过显式建模和强制执行指令优先级。在推理时,我们引入基于求解器的推理,将指令解析建模为约束满足问题,使模型能够在层次约束下派生出一组最大一致的可适用指令。在训练时,NSHA 通过自动构建的监督信息将求解器决策蒸馏到模型参数中。我们在规则遵循、任务执行、工具使用和安全性方面进行评估,覆盖单轮和多轮交互,结果表明NSHA在处理此类冲突时显著提升性能,同时在参考设置下保持竞争力的实用性。

关键词

引用

@article{arxiv.2604.09075,
  title  = {Hierarchical Alignment: Enforcing Hierarchical Instruction-Following in LLMs through Logical Consistency},
  author = {Shu Yang and Zihao Zhou and Di Wang and Wenda Li},
  journal= {arXiv preprint arXiv:2604.09075},
  year   = {2026}
}