借助小模型提升大模型性能:降低成本与提升效果
计算与语言
2024-06-25 v1 人工智能
机器学习
摘要
预训练大模型(PLM),如 ChatGPT,已在各类任务中展现出卓越的性能。然而,PLM 的高计算需求使大多数产品团队不敢运行或微调它们。在这种情况下,必须依赖昂贵的 API,从而加剧经济负担。尽管小模型总体性能较差,但在特定分布下,小模型可实现与甚至更好的结果。因此,某些输入可仅由小模型处理。另一方面,某些任务可拆分为多个子任务,其中一些子任务可在没有强大能力的情况下完成。在这种情况下,小模型可处理简单子任务,让大模型专注于具有挑战性的子任务,从而提升性能。我们提出了数据 shunt(DS),一种小模型与大模型协作的通用范式。DS 不仅大幅降低调用大模型的成本,还有效提升大模型的性能。例如,ChatGPT 在亚马逊产品情感分析中准确率为 ,而 DS 的准确率达到 ,而成本仅为 。此外,实验还证明,所提出的协作式范式比微调更好地将特定任务知识注入 PLM。
引用
@article{arxiv.2406.15471,
title = {Improving Large Models with Small models: Lower Costs and Better Performance},
author = {Dong Chen and Shuo Zhang and Yueting Zhuang and Siliang Tang and Qidong Liu and Hua Wang and Mingliang Xu},
journal= {arXiv preprint arXiv:2406.15471},
year = {2024}
}
备注
11 pages