中文

面向有针对性训练数据生成的教师-学生对齐框架 ARTE

计算与语言 2024-06-28 v1

摘要

大型语言模型 (LLM) 在各类任务中表现出显著潜力,作为 Copilot 使用。当处理隐私敏感数据或延迟敏感任务时,在边缘设备上部署 LLM 是必要的。由于此类设备的计算约束,直接部署强大的大规模 LLM 是不可行的,必须从大规模模型向轻量级模型进行知识蒸馏。目前已有大量工作致力于从 LLM 中挖掘出多样性和高质量的训练样本,但很少关注基于学生偏好对教师指令内容进行对齐,这类似于教育学中的「响应式教学」。因此,我们提出了 ARTE (Aligning TeacheR with StudenT PreferencEs),即「面向有针对性训练数据生成的教师-学生对齐框架」。具体而言,我们从教师模型中抽取草案问题和推理过程,然后以学生在原样学习中的表现作为代理,收集学生对这些问题和推理过程的偏好,并据此对齐教师模型。最终,我们使用对齐后的教师模型重复上述步骤,以生成针对目标任务中学生模型的定制化训练样本。实验表明,ARTE 在学术基准测试上优于来自强大 LLM 蒸馏的现有指令调优数据集。此外,我们全面考察了 ARTE 的泛化性,包括微调后学生模型推理能力的泛化,以及对齐后教师模型在不同任务和不同学生间生成定制化训练数据的泛化。总之,我们的贡献在于提出一种用于定制化训练样本生成的新框架,证明其在实验中的有效性,并探讨了 ARTE 中学生与对齐后教师模型的泛化性。

关键词

引用

@article{arxiv.2406.19227,
  title  = {Aligning Teacher with Student Preferences for Tailored Training Data Generation},
  author = {Yantao Liu and Zhao Zhang and Zijun Yao and Shulin Cao and Lei Hou and Juanzi Li},
  journal= {arXiv preprint arXiv:2406.19227},
  year   = {2024}
}