中文

自验证蒸馏:你的语言模型其实是自己的合成数据管线

计算与语言 2026-05-27 v1 机器学习

摘要

在仅使用无标签提示、无需外部教师或工具反馈的情况下,后训练的大语言模型(LLM)能否进一步自我提升?我们从仅含无标签种子问题(无真实解答)的设置出发,探讨该问题,并覆盖数学、科学和编程三个推理领域。我们提出自验证蒸馏(Self-Verified Distillation)方法,该方法为一种简单的后训练细化算法:模型生成这些种子问题的候选解答,通过基于提示的自我验证进行筛选,并在得到的自 curated 数据集上进行训练。灵感来自 UQ 標準評測中使用多位驗證者篩選難以解答問題的候選答案,我們將此驗證導向的篩選思想應用於自我訓練:模型通過三階段的循環一致性、事實性和正確性檢查對自生成解答進行篩選,僅在所有檢查階段均通過且投票一致時才接受該解答。我們發現,增加候選生成次數以及在訓練數據構造中使用更大的驗證預算可產生更高品質的自 curated 數據,從而提升推理模型的性能。我們隨後在多種規模的 Qwen3 模型上採用自验证蒸馏,並在三個領域均取得提升。對於 Qwen3-4B 模型,本方法在數學(AIME26 和 HMMT)中提升了聚合 held-out pass@1 得分 +16.7 分,在科學(GPQA Diamond 和 HLE)中提升 +11.1 分,在編程(LCBv5 和 LCBv6)中提升 +8.3 分,8B 和 0.6B 模型亦獲得提升。與僅在推理時計算的基線方法(UQ-TTC)相比,自验证蒸馏在大多數情況下取得更佳性能,同時僅需一次推理調用即可完成測試。

关键词

引用

@article{arxiv.2605.26132,
  title  = {Self-Verified Distillation: Your Language Model Is Secretly Its Own Synthetic Data Pipeline},
  author = {Tony Lee and Percy Liang},
  journal= {arXiv preprint arXiv:2605.26132},
  year   = {2026}
}