SFT-GRPO 数据重叠作为后训练超参数的自动化形式化
机器学习
2026-04-16 v1 人工智能
计算机科学中的逻辑
摘要
监督微调 (SFT) 后跟随群相对策略优化 (GRPO) 是一种常见的后训练配方。我们对 SFT-GRPO 数据重叠进行了受控的消融实验,评估了 Qwen3-8B (思考功能已禁用) 在六种不同训练配方下进行的 Lean 4 自动形式化后的训练效果:基础模型、仅 SFT、仅 GRPO,以及三种 SFT+GRPO 配置,其中 0%、30% 或 100% 的 GRPO 提示与 SFT 语料库重合。保持 SFT 和 GRPO 数据完全分离的配置在零额外计算成本下始终优于完全重叠的配置。在 Gaokao-Formal 和 PutnamBench 上的评估结果显示,数据重叠率越低,编译通过率和语义准确率越高。SFT 独立情况下,GRPO 在 Gaokao 上的语义提升为 10.4 个百分点,而在 100% 重叠情况下,两个指标均保持不变,使 GRPO 阶段实际上等价于冗余。我们进一步表明,双指标评估揭示了最高编译模型之间存在超过 30 个百分点的编译-语义差距,而这种差距在仅用编译基准测试时是不可见的。据我们所知,这是对 SFT-GRPO 数据重叠作为后训练超参数的首次受控调查,展示了模型行为如何根据训练阶段之间数据共享程度而有所变化。
引用
@article{arxiv.2604.13515,
title = {SFT-GRPO Data Overlap as a Post-Training Hyperparameter for Autoformalization},
author = {Xiaole Su and Kasey Zhang and Andy Lyu},
journal= {arXiv preprint arXiv:2604.13515},
year = {2026}
}