LLMR:基于大语言模型诱导奖励的知识蒸馏
计算与语言
2024-09-20 v1 人工智能
摘要
大型语言模型在各种自然语言处理(NLP)任务中表现突出,但通常计算昂贵,难以在资源受限的环境中部署。本文提出LLMR,一种基于大型语言模型诱导奖励函数的新型知识蒸馏(KD)方法。我们在对话生成和摘要任务上的多个数据集上进行了实验。实证结果表明,我们的LLMR方法在不同任务和数据集上 consistently优于传统KD方法。
引用
@article{arxiv.2409.12500,
title = {LLMR: Knowledge Distillation with a Large Language Model-Induced Reward},
author = {Dongheng Li and Yongchang Hao and Lili Mou},
journal= {arXiv preprint arXiv:2409.12500},
year = {2024}
}
备注
Accepted by LERC COLING 2024