小模型是大语言模型有价值的插件
计算与语言
2023-05-16 v1 人工智能
机器学习
摘要
GPT-3 和 GPT-4 等大语言模型(LLM)功能强大,但其权重通常不对公众开放,且庞大的规模使得这些模型难以用常见硬件进行调优。因此,利用大规模监督数据有效调优这些模型可能具有挑战性。作为替代,上下文学习(ICL)由于上下文长度限制只能使用少量监督样本。在本文中,我们提出超级上下文学习(SuperICL),它允许黑盒 LLM 与本地微调的小模型协同工作,从而在监督任务上获得更优性能。我们的实验表明,SuperICL 能够超越最先进的微调模型性能,同时解决上下文学习的不稳定性问题。此外,SuperICL 能够增强较小模型的能力,例如多语言性和可解释性。
引用
@article{arxiv.2305.08848,
title = {Small Models are Valuable Plug-ins for Large Language Models},
author = {Canwen Xu and Yichong Xu and Shuohang Wang and Yang Liu and Chenguang Zhu and Julian McAuley},
journal= {arXiv preprint arXiv:2305.08848},
year = {2023}
}