控制错觉:大型语言模型指令层级的失效
计算与语言
2026-03-23 v4 人工智能
摘要
大型语言模型(LLM)日益以分层指令方案进行部署,其中某些指令(如系统级指令)预期优先于其他指令(如用户消息)。然而,我们缺乏对这些分层控制机制有效性的系统性理解。我们提出一种基于约束优先级排序的系统评估框架,用于评估LLM如何有效执行指令层级。我们的实验覆盖六种最先进的LLM,揭示了这些模型在面对简单格式冲突时也难以实现一致的指令优先级。我们发现,广泛采用的系统/用户提示分离未能建立可靠的指令层级,模型表现出对特定约束类型的强烈内在偏好,无论其优先级 designation 为何。有趣地,我们还发现,社会层级框架(如权威、专业知识、共识)对模型行为的影响大于系统/用户角色,这表明预训练中源自的社会结构功能为潜在行为先验,而可能对后训练监护措施的影响更大。
引用
@article{arxiv.2502.15851,
title = {Control Illusion: The Failure of Instruction Hierarchies in Large Language Models},
author = {Yilin Geng and Haonan Li and Honglin Mu and Xudong Han and Timothy Baldwin and Omri Abend and Eduard Hovy and Lea Frermann},
journal= {arXiv preprint arXiv:2502.15851},
year = {2026}
}
备注
Accepted to AAAI-26 Main Technical Track Proceedings