中文

Seir\^enes:基于演化干扰的对抗性自博弈用于大语言模型推理

人工智能 2026-05-13 v1

摘要

我们提出了 Seir\^enes,一个自博弈强化学习框架,它将来自大语言模型推理失效模式的上下文干扰,转化为共同演化出更具鲁棒性推理器的内部训练信号。虽然带有可验证奖励的强化学习显著提升了推理能力,但模型在遇到非理想化上下文时仍可能表现出脆弱性:这些场景的特点是包含多余信息、无关指令或偶然相关性,与标准基准测试中典型的干净分布不同。Seir\^enes 通过一个参数共享的对抗性自博弈循环来利用这一脆弱性。在此框架内,单个模型被训练来同时构建看似合理但具有干扰性的上下文,以暴露其自身的推理盲点,并通过从这些扰动中辨别出核心任务来解决问题,从而恢复底层的核心逻辑。通过让这些相互竞争的目标彼此对抗,Seir\^enes 迫使模型超越表面的模式匹配,将其能力锚定在鲁棒的底层推理之上。随着模型的改进,这种持续的交互维持了一个信息丰富的共同演化课程。在七个数学推理基准测试和从 4B 到 30B 的模型规模上,Seir\^enes 平均分别取得了 +10.2、+9.1 和 +7.2 个百分点的提升。此外,由 4B 的 Seir\^enes 模型产生的干扰上下文,将顶级闭源模型(GPT 和 Gemini)的准确率降低了约 4–5 个百分点,揭示了 Seir\^enes 发现推理模型盲点的通用能力。

关键词

引用

@article{arxiv.2605.11636,
  title  = {Seir\^enes: Adversarial Self-Play with Evolving Distractions for LLM Reasoning},
  author = {Chi Zhang and Haibo Qiu and Qiming Zhang and Yufei Xu and Xinbo Gao and Jing Zhang},
  journal= {arXiv preprint arXiv:2605.11636},
  year   = {2026}
}