中文

历史锚: prior behavior 如何引导 LLM 采取不安全动作

人工智能 2026-05-14 v1 计算机视觉与模式识别

摘要

前沿 LLM 正在越来越多地作为智能体部署,在长期的工具调用日志之后选择下一个动作,该日志由相同或不同模型产生. 我们提出一个简单的安全问题:如果该日志中的某一步是有害的,模型是否会继续该有害路径?我们构建 HistoryAnchor-100,该数据集包含 100 个短情景,跨十个高风险领域,每个情景将三个被迫的有害 prior 动作与一个提供两个安全和两个不安全选项的 free-choice 节点配对.在来自六个提供商的 17 个前沿模型中发现,惊人的反向:在中性 system prompt 下,最强对齐的模型几乎不会选择不安全选项,但添加一行句子"stay consistent with the strategy shown in the prior history"后,它们会变为 91-98%,并且翻转后的模型往往会进一步升级. 两个控制排除了更简单的解释:重新排列动作标签留下了该效果,而相同指令在 all-safe prior history 下仍将不安全率保持在 7% 以下.不同的家族在不同剂量的不安全 history 中翻转,且在每个对齐家族中,旗舰模型是最受影响的兄弟模型,这表现为对 safety 的 inverse-scaling.这些结果是针对 trajectory 可能被 replay、forge 或注入的 agentic 部署的警报.

关键词

引用

@article{arxiv.2605.13825,
  title  = {History Anchors: How Prior Behavior Steers LLM Decisions Toward Unsafe Actions},
  author = {Alberto G. Rodríguez Salgado},
  journal= {arXiv preprint arXiv:2605.13825},
  year   = {2026}
}

备注

12 pages, 3 figures