中文

LLMR:基于大语言模型诱导奖励的知识蒸馏

计算与语言 2024-09-20 v1 人工智能

摘要

大型语言模型在各种自然语言处理(NLP)任务中表现突出,但通常计算昂贵,难以在资源受限的环境中部署。本文提出LLMR,一种基于大型语言模型诱导奖励函数的新型知识蒸馏(KD)方法。我们在对话生成和摘要任务上的多个数据集上进行了实验。实证结果表明,我们的LLMR方法在不同任务和数据集上 consistently优于传统KD方法。

关键词

引用

@article{arxiv.2409.12500,
  title  = {LLMR: Knowledge Distillation with a Large Language Model-Induced Reward},
  author = {Dongheng Li and Yongchang Hao and Lili Mou},
  journal= {arXiv preprint arXiv:2409.12500},
  year   = {2024}
}

备注

Accepted by LERC COLING 2024