Cappy:以小型打分器超越并提升大型多任务语言模型
机器学习
2023-11-14 v1 计算与语言
摘要
诸如T0、FLAN与OPT-IML之类的大型语言模型(LLM),在统一指令遵循范式下擅长多任务处理,并展现出对未见任务的显著泛化能力。尽管性能令人印象深刻,这些参数量从数十亿到数千亿不等的LLM需要大量计算资源,使其训练与推理昂贵且低效。此外,即便利用提示微调等参数高效方法,由于微调所需的庞大硬件需求,将这些模型适配到下游应用(尤其是复杂任务)往往不可行。另外,最强大的多任务LLM(如OPT-IML-175B与FLAN-PaLM-540B)不公开可用,严重限制了其定制潜力。为应对这些挑战,我们引入了一个预训练的小型打分器Cappy,旨在提升多任务LLM的性能与效率。Cappy仅含3.6亿参数,既可独立用于分类任务,也可作为LLM的辅助组件以提升其性能。此外,Cappy无需LLM微调或访问其参数,即可高效整合下游监督信号。我们的实验表明,当在来自PromptSource的11项语言理解任务上独立工作时,Cappy优于大几个数量级的LLM。此外,在来自BIG-Bench的45项复杂任务上,Cappy大幅提升了先进多任务LLM FLAN-T5的性能。进而,Cappy可灵活地与包括微调与上下文学习在内的其他LLM适配方法协作,提供额外的性能增强。
引用
@article{arxiv.2311.06720,
title = {Cappy: Outperforming and Boosting Large Multi-Task LMs with a Small Scorer},
author = {Bowen Tan and Yun Zhu and Lijuan Liu and Eric Xing and Zhiting Hu and Jindong Chen},
journal= {arXiv preprint arXiv:2311.06720},
year = {2023}
}
备注
In proceedings of NeurIPS 2023; Code and model available at https://github.com/tanyuqian/cappy and https://huggingface.co/btan2/cappy-large, respectively