站在巨型冻结语言模型的肩膀上
计算与语言
2022-04-22 v1 人工智能
摘要
庞大的预训练语言模型(LM)已在广泛任务上展现出惊人的零样本能力。这催生了一个引人瞩目的愿景:单一、通用的模型能在不同应用中具备广泛功能。然而,当前利用“冻结”LM(即不改动其权重)的主流技术,仍常逊于以任务依赖方式修改这些权重的微调方法。而后者又存在遗忘性并损害通用性,暗示性能与通用性之间的权衡。本文的核心信息是,当前的冻结模型技术如提示微调(prompt tuning)仅是冰山一角,更强大的利用冻结 LM 的方法能在不牺牲底层模型通用性的前提下,在困难领域中做得与微调一样好。为证明这一点,我们引入三种利用冻结模型的新方法:输入依赖提示微调、冻结阅读器和递归 LM,每一种都大幅改进了当前的冻结模型方法。事实上,某些方法甚至在目前由微调主导的领域中优于微调方法。每种方法的计算成本高于现有冻结模型方法,但相对于单次通过庞大冻结 LM 仍可忽略。这些方法各自都是实质贡献,但我们将它们一并呈现,旨在让读者相信一个超越任何具体方法细节的更广义信息:冻结模型具有未开发的潜力,且微调常常是不必要的。
引用
@article{arxiv.2204.10019,
title = {Standing on the Shoulders of Giant Frozen Language Models},
author = {Yoav Levine and Itay Dalmedigos and Ori Ram and Yoel Zeldes and Daniel Jannai and Dor Muhlgay and Yoni Osin and Opher Lieber and Barak Lenz and Shai Shalev-Shwartz and Amnon Shashua and Kevin Leyton-Brown and Yoav Shoham},
journal= {arXiv preprint arXiv:2204.10019},
year = {2022}
}