Go-tuning:提升较小语言模型的零样本学习能力
计算与语言
2022-12-21 v1
摘要
随着规模的增加,大语言模型展现出定量上的改进和新的定性能力,尤其是作为零样本学习器,如 GPT-3。然而,这些结果严重依赖于精细的提示设计和巨大的计算量。在这项工作中,我们探索是否能在较小的模型规模下,无需任何外部监督数据即可实现强大的零样本能力。为了实现这一目标,我们重新审视了掩码语言建模,并通过利用少量任务感知的自监督数据进一步更新语言模型,提出了一种几何引导的自监督学习方法(简称 Go-tuning)。实验表明,Go-tuning 能够使 T5-small (80M) 获得与大语言模型(如 T5-XL (3B))相媲美的零样本结果。我们还将 Go-tuning 应用于多任务设置,并开发了一个多任务模型 mgo-T5 (250M)。它能够在 9 个数据集上达到 OPT (175B) 的平均性能。
引用
@article{arxiv.2212.10461,
title = {Go-tuning: Improving Zero-shot Learning Abilities of Smaller Language Models},
author = {Jingjing Xu and Qingxiu Dong and Hongyi Liu and Lei Li},
journal= {arXiv preprint arXiv:2212.10461},
year = {2022}
}