利用小型语言模型集成改进上下文学习
计算与语言
2024-12-23 v2
摘要
大型语言模型(LLM)在各种任务中展现出令人印象深刻的能力,但其在特定领域任务上的性能仍然有限。虽然检索增强生成和微调等方法有助于解决此问题,但它们需要大量资源。上下文学习(ICL)是一种廉价且高效的替代方案,但其准确度无法匹敌先进方法。我们提出了Ensemble SuperICL,这是一种通过利用多个微调后的小型语言模型(SLM)的专业知识来增强ICL的新方法。Ensemble SuperICL在多个自然语言理解基准测试上取得了最先进(SoTA)的结果。此外,我们在一个医学领域标注任务上对其进行了测试,并通过使用在通用语言任务上微调的现成SLM展示了其实用性,在大规模数据标注中取得了优于所有基线的准确率。最后,我们进行了消融研究和敏感性分析,以阐明Ensemble SuperICL的底层机制。我们的研究回应了对LLM高效领域专业化方法日益增长的需求,为实践者提供了一种廉价且有效的方法。
引用
@article{arxiv.2410.21868,
title = {Improving In-Context Learning with Small Language Model Ensembles},
author = {M. Mehdi Mojarradi and Lingyi Yang and Robert McCraith and Adam Mahdi},
journal= {arXiv preprint arXiv:2410.21868},
year = {2024}
}
备注
Presented at NeurIPS 2024 Workshop on Adaptive Foundation Models