情境之鬼:测量决策时间装配中的策略- carriage 失效
密码学与安全
2026-05-20 v2
摘要
LLM 智能体并不基于原始交互历史作出决策,而是基于截断、摘要、重新排序和重写等方式组装的受限决策状态。如果包含指令的状态在该步骤中被丢弃、削弱或重新绑定,智能体可能在没有提示覆盖、模型变化或持久记忆妥协的情况下跨越策略边界。我们使用对准约束尊重和直接审计 assembled-state 可见性,在本地 Llama 3.1 8B、Qwen 2.5 7B 和 Mistral 7B 上研究了这一失效模式。我们评估 SafeContext,一个将控制状态固定、重用保留的控制前缀、并在压力下可选注入提醒的控制层,同时保持模型权重不变。未缓解的风险是系统性的,但绝对精确的合规性仍然较低。相对于截断,SafeContext 获得了有限的提升;相对于强结构化压缩策略,大多数聚合提升消失,留下的剩余收益主要来自溢出逐出和选定的别名切片。重播-only 无法解释该效应。在 Qwen 14B 和 Llama 70B 上的更大模型扩展显示,在更大模型下仍存在相同的失效对象,尽管信号和幅度仍取决于策略。因此,决策时间上下文装配是控制路径中可测量的部分,可部分加固。
引用
@article{arxiv.2605.12535,
title = {Ghost in the Context: Measuring Policy-Carriage Failures in Decision-Time Assembly},
author = {Igor Santos-Grueiro},
journal= {arXiv preprint arXiv:2605.12535},
year = {2026}
}