中文

个性化蒸馏:以自适应学习赋能开源大语言模型进行代码生成

计算与语言 2024-01-29 v2 机器学习

摘要

随着强大的闭源大语言模型(ChatGPT、GPT-4)的兴起,将闭源大语言模型的能力蒸馏到较小的开源大语言模型上受到越来越多的关注。以往的蒸馏方法通常提示 ChatGPT 生成一组指令与答案,供学生模型学习。然而,这种标准蒸馏方法忽视了学生模型的优势与条件。受现代教学原则启发,我们设计了一种个性化蒸馏过程:学生先尝试解决任务,随后教师提供自适应改进方案供学生提升。个性化蒸馏不向学生灌输教师的先验知识,而是实现学生模型的个性化学习,因为它仅在学生出错的样本上学习,并学会改进自身的求解方案。在代码生成任务上,个性化蒸馏仅用三分之一的数据便持续优于标准蒸馏。借助仅 2.5-3K 个个性化样本(数据采集成本约 4-6 美元),我们将 CodeGen-mono-16B 提升 7%,在 HumanEval 上达到 36.4% 的 pass@1;将 StarCoder 提升 12.2%,达到 45.8% 的 pass@1。

关键词

引用

@article{arxiv.2310.18628,
  title  = {Personalised Distillation: Empowering Open-Sourced LLMs with Adaptive Learning for Code Generation},
  author = {Hailin Chen and Amrita Saha and Steven Hoi and Shafiq Joty},
  journal= {arXiv preprint arXiv:2310.18628},
  year   = {2024}
}

备注

Accepted to EMNLP 2023; Codes at: https://github.com/SalesforceAIResearch/PersDistill