递归 LLM 循环中的扰动剂量反应:原始切换、随机底部及在追加、替换和对话更新下的持久逃脱
摘要
递归语言模型循环往往会稳定为可识别的吸引子模式。实际问题在于,需要注入多少文本才能将稳定的循环置于其他位置,以及这种置换是否持久。我们通过将模型与上下文更新规则分离来研究这一问题:追加、替换和对话更新将不同历史信息暴露给同一生成器。主要结果表明,在追加模式递归循环中,持久的重新定向取决于记忆策略。在 12,000 字符的尾部裁切下,目的地一致性持久性在剂量 400 时接近 16%,保留源-浴逃脱接近 36%;两者都未达到 50%。在完整历史协议下,保留源-浴逃脱在剂量 400 时超过 50%,并在 1,500 标记时饱和于 75-80%;目的地一致性持久性首先在 1,500 标记时达到 0.50(Wilson 95% 置信区间 [0.41, 0.61])。一种四步伪证电池(异质性控制、层次宏合并的粒度扫描、转换熵诊断以及长期轨迹延续)将高剂量目的地一致性的下降重新诠释为一种有限时域、端点定义敏感的特征,而非稳定结构性不对称。标准规模的一半来自端点时机;在冻结标准聚类基准下,残差从第 29 步的 -0.143 下降到第 79 步的 -0.039,bootstrap 区间跨越零。替换模式下的原始切换在默认协议下接近饱和,但主要反映状态重置覆盖:插入模式探针将其降至 12-32%。我们报告了针对 gpt-4o-mini 的 37 项实验,并对 gpt-4.1-nano 进行了厂商内复制。递归循环评估应区分瞬时移动与持久逃脱,减去随机底部,并将上下文更新规则视为安全相关的设计选择。
引用
@article{arxiv.2605.02236,
title = {Perturbation Dose Responses in Recursive LLM Loops: Raw Switching, Stochastic Floors, and Persistent Escape under Append, Replace, and Dialog Updates},
author = {Pawel Kaplanski},
journal= {arXiv preprint arXiv:2605.02236},
year = {2026}
}
备注
93 pages, 32 figures. Code, configurations, trajectories, and aggregated reports: https://github.com/kaplan196883/llmattr