中文

IH-Challenge:提高前沿大语言模型指令层次结构的训练数据集

人工智能 2026-03-12 v1 计算与语言 密码学与安全 机器学习

摘要

指令层次结构(IH)定义了大语言模型在冲突情境下如何优先处理系统、开发者、用户和工具指令,为解决指令冲突提供具体的、可信的排序策略。IH 是抵御越狱、系统提示提取和智能体式提示注入攻击的关键。然而,IH 行为难以训练:IH 失败可能与指令遵循失败混淆,冲突可能较为细微,且模型可能会学习捷径,如过度拒绝。我们引入 IH-Challenge,一个强化学习训练数据集,以解决这些困难。对 GPT-5-Mini 在 IH-Challenge 上的微调,通过在线对抗性示例生成,使 IH 鲁棒性在 16 个分布内外和人类红队测试中平均提高 10.0%(从 84.1%提升至 94.1%),在提高一般安全评估中的有用性同时将不安全行为从 6.6%降至 0.7%,并在内部静态智能体提示注入评估中达到饱和,同时对能力产生最小的回归。我们发布 IH-Challenge 数据集(https://huggingface.co/datasets/openai/ih-challenge)以支持未来研究中稳健的指令层次结构。

关键词

引用

@article{arxiv.2603.10521,
  title  = {IH-Challenge: A Training Dataset to Improve Instruction Hierarchy on Frontier LLMs},
  author = {Chuan Guo and Juan Felipe Ceron Uribe and Sicheng Zhu and Christopher A. Choquette-Choo and Steph Lin and Nikhil Kandpal and Milad Nasr and Rai and Sam Toyer and Miles Wang and Yaodong Yu and Alex Beutel and Kai Xiao},
  journal= {arXiv preprint arXiv:2603.10521},
  year   = {2026}
}