中文

通过推理路径压缩实现结构化理由蒸馏

计算与语言 2026-05-11 v1 人工智能 机器学习

摘要

在将大型语言模型 (LLM) 的推理蒸馏到更小的模型时,教师对相似问题的理由在结构和策略上往往差异巨大。就像一位厨师每次做同一道菜都采用不同的方法一样,这种不一致给学生提供的噪声监督难以内化。我们提出通过推理路径压缩实现蒸馏 (Distillation through Reasoning Path Compression, D-RPC),该方法约束教师遵循一套紧凑、动态维护的可重用高层次推理路径集合。对于每一道训练题目,D-RPC 检索最相关的路径并指导教师遵循该路径,从而产生跨相似问题结构一致、且足够多样以覆盖不同问题类型的理由。PAC-Bayes 分析形式化了此结果在库存大小与覆盖范围之间的权衡:较小的库存可减少监督熵但风险出现覆盖缺口,泛化界限识别出最佳中间规模,经我们的消融实验确认。我们在五个数学和常识推理基准上使用两种学生模型进行评估,D-RPC 持续优于链式思考蒸馏、自由形式理由生成、直接蒸馏和结构化监督基线,同时使用更少的 token 数优于模板驱动方法。

关键词

引用

@article{arxiv.2605.07139,
  title  = {Structural Rationale Distillation via Reasoning Space Compression},
  author = {Jialin Yang and Jiankun Wang and Jiajun Wu and Henry Leung and Jiayu Zhou and Steve Drew},
  journal= {arXiv preprint arXiv:2605.07139},
  year   = {2026}
}