利用前沿开源LLM进行知识蒸馏:可迁移性与合成数据的作用
广义相对论与量子宇宙学
2024-10-30 v1
摘要
领先的开源大型语言模型(LLM)如Llama-3.1-Instruct-405B在生成文本、回答问题和解决各种自然语言理解任务方面非常强大。然而,这些模型相对于较小的LLM在推理成本和延迟方面具有更高的开销。知识蒸馏提供了一种方法,即使用来自这些大型、高性能教师模型的输出来训练较小的学生模型,以实现较低的推理成本和延迟,同时保持相当的准确率。我们研究了使用Llama-3.1-405B-Instruct教师和较小的Llama-3.1-8B-Instruct和Llama-3.1-70B-Instruct学生模型进行蒸馏的有效性。本工作的贡献包括:(a)我们评估了上述Llama-3.1教师-学生对在不同任务和数据集上的可迁移性;(b)我们表明,在蒸馏期间使用合成数据可显著提高8B和70B模型的准确率,并且在使用推理链时,甚至可在某些数据集上匹配或超越405B模型的零样本准确率;(c)我们经验性地表明,蒸馏使8B和70B模型能够通过仅使用标准微调(而不自定义任何损失函数)来内化405B的推理能力。这允许成本和延迟高效的学生模型推理。(d)我们表明了蒸馏评估中的陷阱,并提出了包括人工和LLM评分以及基于ground-truth的传统准确率基准的任务特定评估。这种方法论研究凸显了知识蒸馏中合成数据质量的根本重要性,以及在评估蒸馏效果时结合多种任务特定方式进行准确性和质量评估的重要性。
引用
@article{arxiv.2410.18587,
title = {Particle Dynamics and Quasi-Periodic Oscillations in the GUP-Modified Schwarzschild Spacetime: Constraint Using Micro-Quasars Data},
author = {Husanboy Hoshimov and Odil Yunusov and Farruh Atamurotov and Mubasher Jamil and Ahmadjon Abdujabbarov},
journal= {arXiv preprint arXiv:2410.18587},
year = {2024}
}
备注
19 pages, 9 figures, 1 tables. To appear in Astroparticle Physics