擦除以提升:可擦除强化学习用于搜索增强型 LLM
计算与语言
2026-04-21 v2 人工智能
信息检索
摘要
虽然搜索增强型大型语言模型(LLM)在某些方面表现突出,但在复杂的多跳推理中其可靠性仍受限。这种限制源于三个根本挑战:分解错误,即任务被错误地分解;检索缺失,即关键证据未能被检索;以及推理错误,即有缺陷的逻辑通过推理链传播。这些阶段任何一个 failure 都可能导致最终答案的失效。我们提出了可擦除强化学习(ERL),一种新型框架,将脆弱的推理转化为稳健的过程。ERL 显式识别有 fault 的步骤,擦除它们并原位重新生成推理,从而防止有缺陷的逻辑通过推理链传播。这种针对性的纠正机制将脆弱推理转化为更具韧性的过程。使用 ERL 训练的模型称为 ESearch,在 HotpotQA、MuSiQue、2Wiki 和 Bamboogle 上实现了显著提升,3B 模型在 EM 上提升 +8.48%,F1 上提升 +11.56%,7B 模型在 EM 上提升 +5.38%,F1 上提升 +7.22%,显著超过以往最先进(SOTA)结果。这些发现表明,可擦除强化学习为 LLM 的稳健多步骤推理提供了强大的范式转变。
引用
@article{arxiv.2510.00861,
title = {Erase to Improve: Erasable Reinforcement Learning for Search-Augmented LLMs},
author = {Ziliang Wang and Kang An and Xuhui Zheng and Faqiang Qian and Weikun Zhang and Cijun Ouyang and Jialu Cai and Yuhang Wang and Yichao Wu},
journal= {arXiv preprint arXiv:2510.00861},
year = {2026}
}
备注
10 pages, 5 figures