单 GPU 下的数据效率:小语言模型迁移方法的探索
计算与语言
2022-10-11 v1
摘要
多任务学习(MTL)、指令微调与提示近来已被证明可提升大语言模型对新任务的泛化能力。然而,此类方法在较小语言模型中的益处较少有文献记载,一些研究得出矛盾结果。本工作中,我们探索并分离了(i)模型规模、(ii)通用 MTL、(iii)领域内 MTL、(iv)指令微调以及(v)少样本微调对参数量少于 5 亿的模型的影响。我们在零样本设定下的实验表明,模型从通用 MTL 平均获得 31% 的相对提升,从领域内 MTL 额外获得 37.6% 的相对增益。与先前关于大模型的工作相矛盾,我们发现指令微调为小模型带来 modest 的 2% 性能提升。
引用
@article{arxiv.2210.03871,
title = {Data-Efficiency with a Single GPU: An Exploration of Transfer Methods for Small Language Models},
author = {Alon Albalak and Akshat Shrivastava and Chinnadhurai Sankar and Adithya Sagar and Mike Ross},
journal= {arXiv preprint arXiv:2210.03871},
year = {2022}
}