中文

ORPO-Distill:面向跨架构LLM蒸馏的混合策略偏好优化

机器学习 2025-09-30 v1 人工智能 计算与语言

摘要

我们引入了 ORPO-Distill,这是一种用于跨架构 LLM 蒸馏的通用方法,它将问题表述为偏好优化任务。与标准的 CoT 蒸馏不同,该方法通过多样化的推理轨迹来传递知识。它采用几率比偏好优化目标,对比教师和学生的轨迹以实现更有效的学习,并采用混合策略来利用学生生成的输出,其表现优于离策略和在策略的替代方案。在五个数据集和多个学生模型上的实验表明,相较于传统的黑盒知识蒸馏(KD)基线,该方法取得了一致的改进。

关键词

引用

@article{arxiv.2509.25100,
  title  = {ORPO-Distill: Mixed-Policy Preference Optimization for Cross-Architecture LLM Distillation},
  author = {Aasheesh Singh and Vishal Vaddina and Dagnachew Birru},
  journal= {arXiv preprint arXiv:2509.25100},
  year   = {2025}
}

备注

Accepted at NeurIPS 2025, Efficient Reasoning Workshop