对齐语言模型的预训练与微调目标
计算与语言
2020-02-07 v1 机器学习
摘要
我们证明,在语言模型训练中显式对齐预训练目标与微调目标,能显著提升微调任务性能并减少所需的最小微调样本量。目标对齐带来的性能优势使我们能够为可用训练数据较少的任务构建更小规模的语言模型。我们通过对关注点概念标注和首字母缩略词检测任务应用目标对齐,提供了这些主张的实证证据。我们发现,通过目标对齐,我们的 768×3 和 512×3 transformer 语言模型在使用每任务仅 200 个微调样本的情况下,分别在关注点概念标注上达到 83.9%/82.5% 的准确率,在首字母缩略词检测上达到 73.8%/70.2% 的准确率,比未经目标对齐预训练的 768×3 模型分别高出 +4.8%/+3.4% 和 +9.9%/+6.3%。我们将在仅有数百或更少训练样本情况下微调小语言模型称为“少样本学习(Few Example Learning)”。在实践中,由目标对齐赋能的少样本学习不仅节省了人工标注成本,还使得在更多实时应用中利用语言模型成为可能。
引用
@article{arxiv.2002.02000,
title = {Aligning the Pretraining and Finetuning Objectives of Language Models},
author = {Nuo Wang Pierse and Jingwen Lu},
journal= {arXiv preprint arXiv:2002.02000},
year = {2020}
}
备注
8 pages, 2 figures and 6 tables. Submitted to ICML 2020