Montessori-Instruct:面向学生学习的高影响训练数据生成
计算与语言
2024-10-21 v1 人工智能
机器学习
摘要
合成数据广泛用于训练大语言模型,但其生成性质不可避免地引入噪声、非信息性和误导性的学习信号。本文提出Montessori-Instruct,一种新颖的数据合成框架,旨�化教师语言模型的数据合成能力,以适应学生语言模型的学习过程。具体而言,我们利用合成训练数据点对学生的局部数据影响来刻画学生的学习偏好。随后,我们采用直接偏好优化(Direct Preference Optimization,DPO)训练教师模型,以生成针对学生学习偏好的合成数据。在Llama3-8B-Instruct(教师)和Llama3-8B(学生)上进行Alpaca Eval和MT-Bench实验,表明Montessori-Instruct相较于标准合成方法分别提升了18.35%和46.24%。我们的 метод还超过由更强教师模型(GPT-4o)生成的数据。进一步分析确认了教师学习生成更具影响力的训练数据对学生学习提升的益处、局部数据影响在准确衡量学生偏好方面的优势,以及Montessori-Instruct在不同学生模型间的鲁棒性。我们的代码和数据已开源于https://github.com/cxcscmu/Montessori-Instruct。
引用
@article{arxiv.2410.14208,
title = {Montessori-Instruct: Generate Influential Training Data Tailored for Student Learning},
author = {Xiaochuan Li and Zichun Yu and Chenyan Xiong},
journal= {arXiv preprint arXiv:2410.14208},
year = {2024}
}
备注
Codes and data are open-sourced at https://github.com/cxcscmu/Montessori-Instruct