中文

WIST: 面向领域目标的 Web 基准迭代自我博弈树

机器学习 2026-03-25 v1 人工智能

摘要

近期进展表明,可验证奖励的强化学习(RLVR)为语言模型自我提升提供了实用路径,但现有方法面临一个关键权衡:内生自我博弈会在迭代过程中漂移,而语料库基准方法则依赖精心策划的数据环境。我们提出了 WIST——一个 W**eb**-grounded **I**terative **S**elf-play **T**ree 框架,用于面向领域目标的推理提升,能够直接从开放 Web 学习,无需任何预先安排的领域语料库。WIST 逐步扩建领域树以进行探索,并检索并清理与路径一致的 Web 语料库以构建可控的训练环境。随后进行 Challenger--Solver 自我博弈,并将可学习信号反馈以更新节点后验概率,指导后续探索通过自适应课程。跨四种 backbone,WIST 均一致优于基础模型,通常优于纯内生自我演化和语料库基准自我博弈基线,整体提升达到 Qwen3-4B-Base 的 **+9.8**,OctoThinker-8B 的 **+9.7**。WIST 亦具领域可调性,在 Qwen3-8B-Base 上医学领域提升 **+14.79**,Qwen3-4B-Base 在 PhyBench 上的提升 **+5.28**。消融实验进一步确认 WIST 关键组件对稳定开放 Web 学习的重要性。我们的 Code 已公开于 https://github.com/lfy-123/WIST。

关键词

引用

@article{arxiv.2603.22352,
  title  = {WIST: Web-Grounded Iterative Self-Play Tree for Domain-Targeted Reasoning Improvement},
  author = {Fangyuan Li and Pengfei Li and Shijie Wang and Junqi Gao and Jianxing Liu and Biqing Qi and Yuqiang Li},
  journal= {arXiv preprint arXiv:2603.22352},
  year   = {2026}
}

备注

23 pages, 4 figures. Submitted to ACL2026