中文

DISA:面向分布匹配LLM-RL的离线重要性抽样方法

机器学习 2026-05-19 v1 计算与语言

摘要

现代推理智能体在生成多个有效解方案、计划或工具使用轨迹方面受到广泛评估。标准的奖励最大化RL倾向于坍缩到最易强化的高奖励模式,而分布匹配RL旨在在整个奖励塑造的解方案集合上分配概率质量。实现此目标需要计算轨迹空间上的提示依赖分区函数。由于现有分布匹配方法在策略学习期间在线学习此分区函数,分区函数的校准误差直接扭曲策略更新且无法独立诊断。我们提出DISA,即解耦重要性抽样锚定(Decoupled Importance-Sampled Anchoring),将校准问题移出RL循环。DISA离线抽取提议轨迹,通过重要性抽样估计分区函数,并在策略优化开始前冻结所得分区函数估计。这种解耦保留了分布匹配目标,同时严格分离分区函数估计与策略学习在数据、梯度、损失和诊断方面。经验上,在两个开源 backbone 上,我们的方法在六个数学和三个代码基准测试中匹配或超过在线耦合分布匹配基线FlowRL,超过奖励最大化基线GRPO和GSPO在数学平均值上,超过LoRASFT蒸馏在相同的离线轨迹上提升了最高13.8个Mean@8分。进一步的LLM作为评判器评估表明,DISA保留了比奖励最大化基线更多的策略级多样性,敏感性研究在提议强度和逆温度上遵循分析预测的偏差-方差模式。

关键词

引用

@article{arxiv.2605.17295,
  title  = {DISA: Offline Importance Sampling for Distribution-Matching LLM-RL},
  author = {Shaobo Wang and Yujie Chen and Yafeng Sun and Wenjie Qiu and Zhihui Xie and Sihang Li and Yucheng Li and Huiqiang Jiang and Xingzhang Ren and Xuming Hu and Dayiheng Liu and Linfeng Zhang},
  journal= {arXiv preprint arXiv:2605.17295},
  year   = {2026}
}

备注

21 pages, 7 figures, 7 tables. Abstract shortened to respect the arXiv limit of 1920 characters. Please see the PDF for the full abstract