中文

硬负样本增强的 DPO 后训练:面向小型语言模型

机器学习 2026-04-15 v2

摘要

大型语言模型(LLM)持续在数学推理方面表现不佳,常见的后训练流程将生成解答简化为二元结果:正确或错误。在实际应用中,这种做法受限,因为链式思维(CoT)推理错误常呈结构化形式,解答可能看似令人信服,却隐藏细微的逻辑、代数或数值缺陷。此外,依赖大型奖励模型或 LLM 作为判官信号的强化学习人类反馈(RLHF)变体往往计算昂贵、难以扩展且不稳定。我们提出一种轻量且务实的后训练流程,旨在针对此类结构化错误,在现实的计算预算下实现目标。我们在 MetaMathQA 风格的 CoT 数据基础上进行监督微调(SFT),引入紧凑的 MathVerifier,将候选解答分解为六维误差轮廓,并聚合为可解释的错误程度和荒谬度评分。这类验证器信号发挥两种作用:(i)挖掘难负样本——即接近正确却在结构上存在缺陷的样本;(ii)定义样本级重要性权重,以突出最具信息量的偏好对。我们将两者整合到基于验证器引导的加权 DPO 目标中。以 1.5B 参数 Qwen2.5 模型为例的实验表明,验证器引导的加权 DPO 在改进方面更具针对性,尤其是在解答数值上接近正确但逻辑不一致的问题上,同时避免训练大型奖励模型或依赖外部判官的开销。

关键词

引用

@article{arxiv.2512.19728,
  title  = {Hard Negative Sample-Augmented DPO Post-Training for Small Language Models},
  author = {Haocheng Lu and Minjun Zhu and Henry Yu},
  journal= {arXiv preprint arXiv:2512.19728},
  year   = {2026}
}