中文

修补分布不匹配:用于稳定离策略监督微调的RL重写智能体

机器学习 2026-02-13 v1 计算与语言

摘要

大型语言模型(LLM)取得了快速进展,但将其适应下游场景仍然普遍依赖于监督微调(SFT)。当下游数据与模型先前的训练分布存在显著分布偏移时,SFT可能导致灾难性遗忘。为缩小这一差距,数据重写被提出作为一种以数据为中心的方法,在SFT之前重写下游训练数据。然而,现有方法通常从提示诱导的条件分布中采样重写结果,因此生成的目标不一定与模型自然的问答式生成分布对齐。此外,对固定模板的依赖可能导致多样性崩溃。为解决这些问题,我们将数据重写视为一个策略学习问题,并学习一个重写策略,使其更好地匹配骨干模型的问答式生成分布,同时保持多样性。由于分布对齐、多样性和任务一致性是可自动评估的,但难以通过可微目标进行端到端优化,我们利用强化学习在奖励反馈下优化重写分布,并提出一个基于RL的数据重写智能体。该智能体在硬任务一致性门控下联合优化问答式分布对齐和多样性,从而为下游SFT构建更高质量的重写数据集。大量实验表明,我们的方法在下游任务上取得了与标准SFT相当的性能提升,同时将非下游基准测试上的遗忘平均减少了12.34%。我们的代码可在https://anonymous.4open.science/r/Patch-the-Prompt-Gap-4112获取。

关键词

引用

@article{arxiv.2602.11220,
  title  = {Patch the Distribution Mismatch: RL Rewriting Agent for Stable Off-Policy SFT},
  author = {Jiacheng Wang and Ping Jian and Zhen Yang and Zirong Chen and Keren Liao and Zhongbin Guo},
  journal= {arXiv preprint arXiv:2602.11220},
  year   = {2026}
}