中文

当 LLM 智能体面对表面噪声时是否如此?基于 68 单元测量研究及持留样轨迹级验证

计算与语言 2026-05-27 v2

摘要

我们记录了链路思考和 ReAct 智能体在十个大型语言模型(来自七个架构家族)中的一个经验现象: 含义携带扰动(如改写、同义词)比相当严重程度的呈现扰动(如格式、重排序)更常改变最终答案。 在跨越 GSM8K、MATH 和 HotpotQA 的 68 个单元格(1530 个原本和约 11150 个变体)中, 在严重程度匹配后 不一致间隙平均为 +19.69 百分点(配对 t=9.58t=9.58p<0.0001p<0.0001), 其中 64/68 单元格为正。 该间隙在四个严重程度代理审计中仍然存在 并在排除 qwen 模型后仍显著(+11.10 百分点, p<0.0001p<0.0001)。 多个压力测试未诚实地失败: 聚类引导显著性在更严格假设下消失, 可行性对比未复制, 跨架构生成器交换破坏单元格级排名, 第二个 LLM 评判器仅实现中度一致性(κ=0.50\kappa=0.50)。 我们随后在完全持留样 11 个模型(qwen2.5-14B-Instruct; 1800 个轨迹)上验证标题效应 并重新测试一个预先注册的能力×\times可行性分区, 在持留样轨迹中观察到一个小但正的持留样效应(3/4 单元格为正; 合并 Welch t=3.81t=3.81p=9.6×104p=9.6\times10^{-4})。 通过持留样轨迹,我们探测了四个轨迹级机制信号。 两个先前的机制主张未复制 被明确撤回。 两个新的探针则支持一种\emph{stealth-divergence}图景: 语义扰动通常保留第一个动作 但在后续步骤开始时引起推理分歧 并伴随稍深的轨迹。 我们将此定位为一种具有持留样复制的测量贡献 以及语义扰动如何通过智能体推理传播的部分轨迹级解释。 代码、扰动语料库、原始轨迹 和分析脚本均匿名发布以供审查。

关键词

引用

@article{arxiv.2605.25981,
  title  = {When Do LLM Agents Treat Surface Noise Differently from Semantic Noise? A 68-Cell Measurement Study with a Held-Out Trace-Level Validation},
  author = {Liyun Zhang and Jiayi Guo},
  journal= {arXiv preprint arXiv:2605.25981},
  year   = {2026}
}