中文

整合还是适应?PRISM:基于梯度浓度解耦 SFT 与 RL 数据

人工智能 2026-04-14 v2 机器学习

摘要

虽然混合式监督微调(SFT)后跟强化学习(RL)已成为训练 LLM agent 的标准范式,但在这两个阶段之间进行数据分配的有效机制仍 largely 未被探索。当前的数据仲裁策略常依赖表面化的启发式方法,无法诊断内在学习需求。由于 SFT 通过模仿实现模式整合,而 RL 通过探索驱动结构适应,数据与这些功能性角色错配会导致严重的优化干扰。我们提出 PRISM,一个基于 Schema Theory 的 dynamics-aware 框架,通过分析梯度的空间几何结构来仲裁数据。PRISM 识别引发高空间浓度的数据作为 high-conflict 信号,这些信号需要 RL 进行结构重构。相比之下,产生 diffuse 更新的数据被路由到 SFT 以实现高效整合。在 WebShop 和 ALFWorld 上的大量实验表明,PRISM 实现了帕累托改进,超越了最新的混合方法,同时将计算成本降低最高可达 3.22×\times。我们的发现表明,基于内部优化 regime 解耦数据对可扩展且稳健的 agent 对齐至关重要。

关键词

引用

@article{arxiv.2601.07224,
  title  = {Consolidation or Adaptation? PRISM: Disentangling SFT and RL Data via Gradient Concentration},
  author = {Yang Zhao and Yangou Ouyang and Xiao Ding and Hepeng Wang and Bibo Cai and Kai Xiong and Jinglong Gao and Zhouhao Sun and Li Du and Bing Qin and Ting Liu},
  journal= {arXiv preprint arXiv:2601.07224},
  year   = {2026}
}

备注

ACL2026 Main Conference