基于见证解决概况的LLM智能体实时策略内指令冲突诊断
人工智能
2026-05-28 v1
摘要
LLM智能体受长期存在的自然语言提示策略所支配,但各自合理的固定规则可能以未经检查的方式相互作用。我们研究实时策略内规则冲突诊断:在单个提示策略内寻找能够共同支配现实状态的规则对,并衡量模型在响应或工具动作中如何解决这种压力。我们引入了WIRE,一个见证式策略内规则评估流水线。WIRE提取基于来源的规则,将其编码为PyRule子句,利用可满足性检查保留同表面硬碰撞候选,将这些候选实现为具体的共同支配见证,并根据原始源规则文本判断模型输出。在六个公共提示策略上,WIRE提取了276条源规则和560个原子子句,分类了30,944个策略内子句对比较,保留了170个编码后的硬碰撞候选源规则对,并将其实现为1,402个具体见证。在仅策略评估中,这些见证产生了13,335次生成后试验,其中两个源规则均起支配作用且两个合规标签均可判断。仅有35.4%属于联合合规;64.6%违反了至少一条被支配的源规则。这些概况是针对WIRE选定候选的条件性诊断,而非部署频率或因果超额失败估计,但它们揭示了不同的策略、模型和工具动作解决模式。
引用
@article{arxiv.2605.27784,
title = {Diagnosing Live Within-Policy Instruction Conflicts in LLM Agents with Witnessed Resolution Profiles},
author = {Lu Yan and Xuan Chen and Xiangyu Zhang},
journal= {arXiv preprint arXiv:2605.27784},
year = {2026}
}