中文

神经机器翻译模型可以学会成为少样本学习器

计算与语言 2023-09-18 v1

摘要

大型语言模型使用少量示例学习在全新领域和任务中执行的能力(也称为上下文学习,ICL)是一种涌现能力。在这项工作中,我们展示了通过面向专门训练目标进行微调,可以训练小得多的模型来执行 ICL,并以神经机器翻译的领域适应任务为例。借助这种 ICL 能力,模型可以利用相关的少样本示例将其输出适应到该领域。我们将这种领域适应的质量与传统监督技术和采用 400 亿参数大型语言模型的 ICL 进行比较。我们的方法允许在混合领域上进行高效批量推理,并在翻译质量和即时适应率(即在给定单个示例后复现特定术语的能力)方面均优于最先进的基线。

关键词

引用

@article{arxiv.2309.08590,
  title  = {Neural Machine Translation Models Can Learn to be Few-shot Learners},
  author = {Raphael Reinauer and Patrick Simianer and Kaden Uhlig and Johannes E. M. Mosig and Joern Wuebker},
  journal= {arXiv preprint arXiv:2309.08590},
  year   = {2023}
}