中文

daDPO:基于分布感知的 DPO 用于提炼对话能力

机器学习 2025-06-23 v1 人工智能 计算与语言

摘要

大型语言模型(LLM)在 various applications 中展现出卓越性能,但随模型规模减小,對話能力急劇下降,成为在资源受限环境中部署的障碍。以 Direct Preference Optimization(dDPO)进行知识蒸馏已成为增强小模型對話能力的有前景方法。然而,现有方法主要关注“黑箱”蒸馏,仅使用教师的回复,忽略了教师提供的输出分布。本文通过引入 daDPO(Distribution-Aware DPO),一种统一的偏好优化和分布基方法,弥补了这一差距。我们提供严格的理论分析和实证验证,表明 daDPO 在恢复被修剪模型性能以及增强小型 LLM 模型方面优于现有方法。值得注意的是,在域内评估中,我们的方法使 20% 被修剪的 Vicuna1.5-7B 达到接近教师水平(相较于 dDPO 的 -31%,仅 -7.3% 偏好率),并使 Qwen2.5-1.5B 偶尔超过其 7B 教师模型(14.0% 胜率)。

关键词

引用

@article{arxiv.2506.15717,
  title  = {daDPO: Distribution-Aware DPO for Distilling Conversational Abilities},
  author = {Zhengze Zhang and Shiqi Wang and Yiqun Shen and Simin Guo and Dahua Lin and Xiaoliang Wang and Nguyen Cam-Tu and Fei Tan},
  journal= {arXiv preprint arXiv:2506.15717},
  year   = {2025}
}