ORPO-Distill:面向跨架构LLM蒸馏的混合策略偏好优化
机器学习
2025-09-30 v1 人工智能
计算与语言
摘要
我们引入了 ORPO-Distill,这是一种用于跨架构 LLM 蒸馏的通用方法,它将问题表述为偏好优化任务。与标准的 CoT 蒸馏不同,该方法通过多样化的推理轨迹来传递知识。它采用几率比偏好优化目标,对比教师和学生的轨迹以实现更有效的学习,并采用混合策略来利用学生生成的输出,其表现优于离策略和在策略的替代方案。在五个数据集和多个学生模型上的实验表明,相较于传统的黑盒知识蒸馏(KD)基线,该方法取得了一致的改进。
引用
@article{arxiv.2509.25100,
title = {ORPO-Distill: Mixed-Policy Preference Optimization for Cross-Architecture LLM Distillation},
author = {Aasheesh Singh and Vishal Vaddina and Dagnachew Birru},
journal= {arXiv preprint arXiv:2509.25100},
year = {2025}
}
备注
Accepted at NeurIPS 2025, Efficient Reasoning Workshop