FreeLM:免微调语言模型
计算与语言
2023-05-03 v1 人工智能
摘要
预训练语言模型(PLMs)在 NLP 任务中取得了显著成功。尽管成就巨大,主流方案很大程度上遵循预训练然后微调的范式,这带来了高部署成本与低训练效率。然而,在特定任务上微调是必要的,因为 PLMs 仅从大规模原始数据中以语言信号预训练。在本文中,我们提出一种新颖的免微调语言模型策略,同时考虑语言信号与教师信号。教师信号是一系列下游任务的抽象,以统一的命题格式提供。以交互方式同时使用语言和强任务感知教师信号训练,我们的 FreeLM 模型展现出强大的泛化性与鲁棒性。实验中,FreeLM 在一系列语言理解任务上优于 GPT-3 和 InstructGPT 等大模型。与这些模型 175B 参数相比,FreeLM 仅 0.3B 参数,规模小得多。
引用
@article{arxiv.2305.01616,
title = {FreeLM: Fine-Tuning-Free Language Model},
author = {Xiang Li and Xin Jiang and Xuying Meng and Aixin Sun and Yequan Wang},
journal= {arXiv preprint arXiv:2305.01616},
year = {2023}
}