中文

利用大语言模型通过知识蒸馏和优化训练策略增强 NLP 任务性能

计算与语言 2024-03-26 v4

摘要

新兴的大语言模型(LLM)如 GPT-4 已经彻底改变了自然语言处理(NLP),在命名实体识别(NER)等传统任务中显示出潜力。我们的研究探索了一种三阶段训练策略,利用 GPT-4 的能力来增强 BERT 模型在 NER 上的性能。最初,GPT-4 在不进行微调的情况下标注 CONLL2003 和部分额外 BBC 数据集的子集。然后,我们使用原始数据和 LLM 标注数据的混合来训练 BERT,分析 LLM 标注与传统方法相比的有效性。第二阶段涉及不同训练方案的对比实验,评估蒸馏数据与原始数据之间的协同作用。我们观察到,顺序策略,特别是先用蒸馏数据训练再用原始数据训练的简单混合,显著提高了性能。在第三阶段,我们研究了各种数据混合技术,包括 sigmoid 和幂律衰减函数,以进一步优化训练过程。我们的结果表明,蒸馏数据和原始数据的战略混合显著提升了 BERT 的 NER 能力。我们的方法提出了一种可扩展的方法论,减少了人工标注成本并提高了效率,使其在资源有限和封闭网络环境中尤其相关。研究结论认为,虽然“简单混合”策略产生了最佳结果,但理解其潜在机制需要进一步研究。未来的工作还将侧重于改进提示设计和增强标注选择过程,旨在将我们的方法论扩展到多样化的 NLP 任务。

关键词

引用

@article{arxiv.2402.09282,
  title  = {Leveraging Large Language Models for Enhanced NLP Task Performance through Knowledge Distillation and Optimized Training Strategies},
  author = {Yining Huang and Keke Tang and Meilian Chen},
  journal= {arXiv preprint arXiv:2402.09282},
  year   = {2024}
}

备注

16 pages, 3 figures