LLM代理的多层次指令层次结构
计算与语言
2026-04-15 v3 人工智能
摘要
大型语言模型(LLM)代理来自多个来源的指令——系统消息、用户提示、工具输出、其他代理等——每种指令都携带不同的信任和授权级别。当这些指令发生冲突时,代理必须可靠地遵循最高授权指令以保持安全和有效性。当前主流范例中,指令层次(IH)假设固定的、小型的授权级别集合(通常少于五个),通过僵化的角色标签(例如系统>用户)定义。这对于实际的代理场景不够,因为冲突可以跨越更多的来源和情境。本文提出多层次指令层次结构(ManyIH),一种用于解决任意数量授权级别指令冲突的范式。我们引入ManyIH-Bench,首个针对ManyIH的基准测试。ManyIH-Bench要求模型在最高可达12个冲突指令层次中导航,涵盖853个代理任务(427个编码和426个指令遵循)。ManyIH-Bench由LLM生成的约束组合而成,这些约束经人类验证,旨在创建真实且具有挑战性的测试用例,跨越46个真实代理情境。我们的实验表明,即便是当前前沿模型在指令冲突规模化时也表现不佳(约40%准确率)。本工作凸显了针对代理场景中细粒度、可扩展指令冲突解决方法的紧迫需求。
引用
@article{arxiv.2604.09443,
title = {Many-Tier Instruction Hierarchy in LLM Agents},
author = {Jingyu Zhang and Tianjian Li and William Jurayj and Hongyuan Zhan and Benjamin Van Durme and Daniel Khashabi},
journal= {arXiv preprint arXiv:2604.09443},
year = {2026}
}