中文

面向少样本学习的语言模型持续训练

计算与语言 2022-10-12 v1 人工智能 机器学习 神经与进化计算

摘要

近期应用大型语言模型的工作在许多 NLP 应用中取得了令人瞩目的性能。使用未标注领域语料库调整或后训练语言模型,可以为该领域的终端任务带来更好的性能。本文提出了通过一系列未标注领域语料库增量后训练语言模型以持续扩展语言模型的问题,旨在扩展其知识而不遗忘先前技能。目标是改善这些领域中的少样本终端任务学习。由此产生的系统被称为 CPT(Continual PostTraining,持续后训练),据我们所知,这是首个持续后训练系统。实验结果验证了其有效性。

关键词

引用

@article{arxiv.2210.05549,
  title  = {Continual Training of Language Models for Few-Shot Learning},
  author = {Zixuan Ke and Haowei Lin and Yijia Shao and Hu Xu and Lei Shu and Bing Liu},
  journal= {arXiv preprint arXiv:2210.05549},
  year   = {2022}
}