中文

噪声中的迷失:如何因情境干扰因素而导致推理模型失效

人工智能 2026-01-13 v1 计算与语言

摘要

最新推理模型和智能体 AI 系统的进展导致日益依赖多样化的外部信息。然而,这一转变引入了本质上噪声的输入上下文,而当前的已消除基准未能捕捉这一现实。我们引入 NoisyBench,一个综合性基准,系统评估模型在 RAG、推理、对齐和工具使用任务中针对多种噪声类型(包括随机文档、无关聊天记录和硬负样本干扰)的鲁棒性。我们的评估显示,在面对情境干扰时,最先进模型的性能会 catastrophic 下降最高可达 80%。关键的是,我们发现智能体工作流程往往会通过过度信任噪声工具输出来放大这些错误,而且干扰项即使不具备对抗性意图,也可能触发突现性误对齐。我们发现,提示、上下文工程、SFT 和仅基于结果的 RL 均无法确保鲁棒性;相比之下,我们提出的基于理由感知奖励(Rationale-Aware Reward, RARE)显著加强了韧性,通过激励识别噪声中的有用信息。最后,我们发现测试时计算增加会导致在噪声环境下的表现恶化,并通过注意力可视化证明模型在不成比例地关注干扰标记,为构建下一代健壮、具推理能力的智能体提供了关键见解。

关键词

引用

@article{arxiv.2601.07226,
  title  = {Lost in the Noise: How Reasoning Models Fail with Contextual Distractors},
  author = {Seongyun Lee and Yongrae Jo and Minju Seo and Moontae Lee and Minjoon Seo},
  journal= {arXiv preprint arXiv:2601.07226},
  year   = {2026}
}

备注

Preprint