打破壁垒:强化后训练带来的增益能否迁移至未见领域?
计算与语言
2026-03-03 v3
摘要
强化后训练(RPT)近期在提升大型语言模型(LLM)的推理能力方面展现出潜力。然而,这些改进在多大程度上能泛化到新领域仍不清楚,因为先前的工作仅在与后训练所用数据相同的领域上评估RPT模型。为了理解RPT的泛化性,我们开展了两项研究,重点关注基于可验证奖励的强化学习(RLVR)。(1)观察性研究:我们比较了多种开源权重RPT模型与其对应的基础模型在多个领域(包括其微调数据中已见和未见领域)上的表现。(2)干预性研究:我们在单一领域上使用RPT微调LLM,并评估其在多个领域上的性能。两项研究得出了相同的结论:尽管RPT在与微调数据相似的任务上带来了显著增益,但这些增益的泛化并不一致,并且可能在具有不同推理模式的领域中消失。
引用
@article{arxiv.2506.19733,
title = {Breaking Barriers: Do Reinforcement Post Training Gains Transfer To Unseen Domains?},
author = {Chuxuan Hu and Yuxuan Zhu and Antony Kellermann and Caleb Biddulph and Suppakit Waiwitlikhit and Jason Benn and Daniel Kang},
journal= {arXiv preprint arXiv:2506.19733},
year = {2026}
}
备注
ICLR 2026; 9 pages, 4 figures, 2 tables