通过引导式对抗自博弈学习鲁棒推理
机器学习
2026-02-03 v1 人工智能
摘要
基于可验证奖励的强化学习(RLVR)产生了强大的推理模型,但当条件上下文存在错误时(例如,损坏的思维链、误导性的部分解或轻微的输入扰动),它们可能会灾难性地失败,因为标准RLVR仅在干净条件下优化最终答案的正确性。我们引入了GASP(引导式对抗自博弈),这是一种鲁棒化方法,仅使用结果验证来显式训练检测与修复能力。无需人工标签或外部教师,GASP在单个模型内形成一个对抗性自博弈游戏:一个污染者学习通过局部连贯的损坏来诱导失败,而一个智能体则学习在相同的损坏条件下诊断和恢复。为了解决训练早期成功恢复样本稀缺的问题,我们提出了分布内修复引导,这是一种对自生成修复的模仿项,它在保留先前获得的能力的同时提高了恢复概率。在四个开放权重模型(1.5B-8B)上,GASP将强大但脆弱的推理者转变为鲁棒的推理者,能够抵御误导性和扰动的上下文,同时通常还能提高干净准确率。进一步的分析表明,对抗性损坏引入了一个有效的课程学习,而分布内引导则能够以最小的表征漂移实现快速恢复学习。
引用
@article{arxiv.2602.00173,
title = {Learning Robust Reasoning through Guided Adversarial Self-Play},
author = {Shuozhe Li and Vaishnav Tadiparthi and Kwonjoon Lee and Nakul Agarwal and Hossein Nourkhiz Mahjoub and Ehsan Moradi Pari and Lizhang Chen and Amy Zhang and Liu Leqi},
journal= {arXiv preprint arXiv:2602.00173},
year = {2026}
}