AgentInstruct:基于智能体流的生成式教学
人工智能
2024-07-08 v1 计算与语言
机器学习
摘要
合成数据对于加速大型和小型语言模型的开发正变得日益重要。尽管已有若干成功用例,研究人员也提出了关于模型崩溃和模仿其他模型缺陷的担忧。这种差异可归因于合成数据在质量和多样性上存在差异。有效利用合成数据通常需要大量的人工数据整理工作。我们关注将合成数据用于后训练,具体而言,即利用强大模型创建数据以向另一模型教授新技能或行为,我们将此设定称为生成式教学。我们提出了 AgentInstruct,这是一个可扩展的智能体框架,用于自动创建大量多样且高质量的合成数据。AgentInstruct 仅需使用文本文档和代码文件等原始数据源作为种子,即可同时创建提示和回复。我们通过创建一个包含 2500 万对数据的后训练数据集来展示 AgentInstruct 的效用,以向语言模型教授文本编辑、创意写作、工具使用、编程、阅读理解等不同技能。该数据集可用于任何基础模型的指令微调。我们使用该数据对 Mistral-7b 进行后训练。将所得模型 Orca-3 与 Mistral-7b-Instruct(使用相同基础模型)进行比较,我们观察到在多项基准测试上均有显著提升。例如,在 AGIEval 上提升 40%,在 MMLU 上提升 19%,在 GSM8K 上提升 54%,在 BBH 上提升 38%,在 AlpacaEval 上提升 45%。此外,它持续优于 LLAMA-8B-instruct 和 GPT-3.5-turbo 等其他模型。
引用
@article{arxiv.2407.03502,
title = {AgentInstruct: Toward Generative Teaching with Agentic Flows},
author = {Arindam Mitra and Luciano Del Corro and Guoqing Zheng and Shweti Mahajan and Dany Rouhana and Andres Codas and Yadong Lu and Wei-ge Chen and Olga Vrousgos and Corby Rosset and Fillipe Silva and Hamed Khanpour and Yash Lara and Ahmed Awadallah},
journal= {arXiv preprint arXiv:2407.03502},
year = {2024}
}