中文

稳健推理基准

机器学习 2026-05-22 v2 人工智能 计算与语言

摘要

虽然大型语言模型 (LLM) 在标准数学基准上取得高分,但其问题解决能力依赖于上下文和文本格式。我们引入稳健推理基准 (RRB),对 AIME 2024 和 AIME 2025 应用 13 种确定性文本扰动。评估 8 个最前沿模型后发现,前沿模型在结构性噪声下表现出广泛的失效模式:认知喧嚣、分词崩溃和推理坍塌,部分扰动下准确率下降最高达 54%,某些情形下下降 100%。我们进一步单独研究了这种失效模式:由模型自身链式思维导致的注意力稀释。通过让模型在单个上下文窗口中顺序解决多个独立数学问题,我们识别出“查询内注意力稀释”。参数从 7B 到 120B 的开源模型均表现出在后续问题上的准确率衰减,表明中间推理步骤会逐渐污染标准稠密注意力机制。我们认为,若要实现可靠推理,未来架构需要在模型自身的链式思维中集成显式的上下文重置,这引出关于推理任务最佳粒度的开放性研究问题。

关键词

引用

@article{arxiv.2604.08571,
  title  = {Robust Reasoning Benchmark},
  author = {Pavel Golikov and Evgenii Opryshko and Gennady Pekhimenko and Mark C. Jeffrey},
  journal= {arXiv preprint arXiv:2604.08571},
  year   = {2026}
}