中文

基因生成:规模化合成编码指令的演化方法

计算与语言 2025-05-26 v3 机器学习 神经与进化计算

摘要

大型语言模型(LLMs)需要高质量指令数据才能有效对齐,尤其是在代码生成任务中,专家精选数据集昂贵且难以获取。我们提出了 Genetic-Instruct,一种用于合成大规模高质量编码指令的可扩展算法。该算法基于演化原理,从小规模的种子指令开始,通过利用 Instructor-LLM 进行生成、Coder-LLM 进行代码合成和 Judge-LLM 进行自动质量评估,生成多样且具挑战性的指令-代码对。我们提出的方法高度可并行化,即使在种子数据有限且生成模型较弱的情况下也能有效运行。我们生成了超过 750 万条编码指令。随后,我们通过微调 LLMs 并使用合成样本进行评估,证明其在代码生成能力方面显著优于其他合成生成方法和公开数据集。我们的结果凸显了 Genetic-Instruct 框架的效率、可扩展性和通用性。

关键词

引用

@article{arxiv.2407.21077,
  title  = {Genetic Instruct: Scaling up Synthetic Generation of Coding Instructions for Large Language Models},
  author = {Somshubra Majumdar and Vahid Noroozi and Mehrzad Samadi and Sean Narenthiran and Aleksander Ficek and Wasi Uddin Ahmad and Jocelyn Huang and Jagadeesh Balam and Boris Ginsburg},
  journal= {arXiv preprint arXiv:2407.21077},
  year   = {2025}
}

备注

Accepted to be presented in ACL 2025