解耦后集成:基于任务向量的 SFT 与 RLVR 测试时合成
机器学习
2026-05-04 v1
摘要
SFT 与 RLVR 分别代表了 LLM 后训练中两种基本且互不相同 paradigms,分别在不同维度上取得卓越成绩。SFT 扩展知识广度,而 RLVR 增强推理深度。然而,这两种互补的优势集成仍然是一个巨大的挑战。顺序训练会导致灾难性遗忘,联合优化往往 suffer 从严重的梯度冲突。我们通过任务向量的视角分析 SFT 与 RLVR,揭示了三种结构性特征:30 倍的 magnitude 差异、45 倍的符号干扰,以及异构的模块级更新分布。这些发现表明,SFT 与 RLVR 难以直接集成,但也暗示了这两种 paradigms 修改了模型的部分互补组件。鼓励这些观察,我们提出了解耦测试时合成(DoTS),一种后处理框架,允许 SFT 与 RLVR 检查点独立训练,仅在推理时通过任务向量算术合成其能力,无需更新模型参数。为减少干扰,DOTS 应用选择性稀疏化并进行保持范数的 rescaling。随后使用贝叶斯优化在小组无标签查询上搜索 Pareto 前沿上一致性和 perplexity 的组合系数。经实验证明,\ours 在多个数学推理基准测试中匹配或超过基于训练的 SFT--RLVR 集成方法,仅计算成本的 ~3%。当应用于更强的后训练检查点时,DOTS 超越 SOTA 模型并能在无重新调谨的情况下推广到跨域基准测试。代码地址:https://github.com/chaohaoyuan/DoTS。
引用
@article{arxiv.2605.00610,
title = {Decouple before Integration: Test-time Synthesis of SFT and RLVR Task Vectors},
author = {Chaohao Yuan and Chenghao Xiao and Yu Rong and Hong Cheng and Long-Kai Huang},
journal= {arXiv preprint arXiv:2605.00610},
year = {2026}
}