中文

PAINT:部分解决方案自适应插值训练用于自蒸馏推理器

机器学习 2026-04-30 v1

摘要

提高大语言模型(LLM)推理能力需要监督信号既与模型自身测试时状态一致,又在token级别上提供信息。基于可验证奖励的强化学习提供了有策略的探索,但奖励稀疏且方差大;监督微调和蒸馏提供稠密目标,但常在固定轨迹上训练或依赖更强的教师。最近的受 privileged on-policy自蒸馏通过对学生 rollout采用相同的经过验证解决方案进行评分,探索了其中间态。我们从情境重评角度重新审视此设置:对于推理而言,重要选择不仅在于是否提供特权上下文,更在于应暴露多少以及其分布应如何塑造学生。我们提出PAINT(Partial-solution Adaptive INterpolated Training),根据rollout-reference重叠遮蔽已验证解决方案,并在稀疏的熵不匹配token位置上应用小能量空间插值。在竞赛水平的数学基准上,PAINT在所有三个Qwen3规模上均优于强大的先前基于on-policy自蒸馏的基线。Qwen3-8B上,PAINT相对于该基线提升了2.1分,相对于GRPO提升了2.9分。

关键词

引用

@article{arxiv.2604.26573,
  title  = {PAINT: Partial-Solution Adaptive Interpolated Training for Self-Distilled Reasoners},
  author = {Zhiquan Tan and Yinrong Hong},
  journal= {arXiv preprint arXiv:2604.26573},
  year   = {2026}
}