不可能三角:预训练语言模型的下一步是什么?
计算与语言
2022-04-21 v2
摘要
大规模预训练语言模型(PLM)的近期发展显著提升了模型在各种 NLP 任务中的能力,体现在任务特定微调后的性能以及零样本/少样本学习方面。然而,许多此类模型具有令人望而生畏的庞大尺寸,少数机构能够负担预训练、微调甚至部署的费用,而中等规模模型通常缺乏强大的泛化少样本学习能力。本文中,我们首先从不可能三角的角度阐述当前使用 PLM 模型的障碍:1)中等模型尺寸,2)最先进的少样本学习能力,3)最先进的微调能力。我们认为所有现有 PLM 模型均缺乏不可能三角中的一项或多项属性。为弥补 PLM 的这些缺失属性,已提出多种技术,如知识蒸馏、数据增强和提示学习,这不可避免地给 PLM 在真实场景中的应用带来额外工作。随后,我们对实现不可能三角的 PLM 未来研究方向提供见解,并将该任务拆解为若干关键阶段。
引用
@article{arxiv.2204.06130,
title = {Impossible Triangle: What's Next for Pre-trained Language Models?},
author = {Chenguang Zhu and Michael Zeng},
journal= {arXiv preprint arXiv:2204.06130},
year = {2022}
}