YODA:面向语言模型的师生渐进式学习
计算与语言
2024-01-30 v1 人工智能
机器学习
摘要
尽管大型语言模型(LLM)在一系列任务中展现出了出色的能力,但它们的学习效率仍落后于人类。这种差距通常与人类固有的能力有关:从基础示例中学习,逐渐泛化并处理更复杂的问题,并通过持续反馈来完善其技能。受此启发,本文介绍了 YODA,一种新颖的师生渐进式学习框架,它模拟师生教育过程以提高模型微调的效率。该框架在交互式的 \textit{基础-泛化-进阶} 循环上运行。教师智能体对学生给出的答案提供量身定制的反馈,并系统地组织教育过程。该过程通过教授学生基础示例展开,通过泛化问题强化理解,然后通过提出复杂度逐步提升的问题来增强学习。在教师的指导下,学生学会根据反馈迭代地完善其答案,并对所提出的问题形成稳健且全面的理解。反映人类渐进式学习过程的系统化过程数据随后被用于模型训练。以数学推理为测试平台,实验表明,使用来自 YODA 的数据训练 LLaMA2 改进了 SFT,并获得了显著的性能提升(在 GSM8K 上提升 17.01%,在 MATH 上提升 9.98%)。此外,我们发现采用课程学习进行训练进一步提高了学习的鲁棒性。
引用
@article{arxiv.2401.15670,
title = {YODA: Teacher-Student Progressive Learning for Language Models},
author = {Jianqiao Lu and Wanjun Zhong and Yufei Wang and Zhijiang Guo and Qi Zhu and Wenyong Huang and Yanlin Wang and Fei Mi and Baojun Wang and Yasheng Wang and Lifeng Shang and Xin Jiang and Qun Liu},
journal= {arXiv preprint arXiv:2401.15670},
year = {2024}
}
备注
14 pages, 4 figures, 3 tables