语言模型的学习件:专用小语言模型也能做大贡献
机器学习
2025-05-20 v1 人工智能
摘要
学习件范式为机器学习提供了一种新颖方法,使用户能够复用一组训练良好的模型来完成超出模型原始用途的任务。它消除了从头构建模型的需求,转而依赖规格说明(表示模型能力的表征)来识别和利用最适合新任务的模型。尽管学习件在许多场景中已被证明有效,但其在语言模型中的应用仍 largely 未被探索。与此同时,大语言模型(LLMs)已展现出显著的通用问答能力,但它们在专门场景中面临数据稀缺、隐私关切和计算成本高的挑战,因此越来越多的小语言模型(SLMs)被训练用于特定领域。为系统地解决这些限制,学习件范式提供了一种有前景的解决方案,通过实现对专用SLMs的最大利用,并允许用户以协作和隐私保护的方式识别和复用它们。本文呈现了将学习件范式应用于语言模型的初步尝试。我们模拟了一个包含约100个学习件的学习件系统,每个学习件为具有8B参数的专用SLM,在金融、医疗和数学领域进行了微调。每个学习件包含一个SLM和一个规格说明,使用户能够在不暴露自身数据的情况下识别最相关的模型。实验结果展示了有前景的性能:通过为每个任务特定推理选择一个合适的学习件,该系统在所有基准测试上优于基础SLMs。与LLMs相比,该系统在金融领域任务中比Qwen1.5-110B、Qwen2.5-72B和Llama3.1-70B-Instruct至少高出14%,在医疗领域任务中超越了Flan-PaLM-540B(在Open Medical LLM排行榜上排名第7)。
引用
@article{arxiv.2505.13425,
title = {Learnware of Language Models: Specialized Small Language Models Can Do Big},
author = {Zhi-Hao Tan and Zi-Chen Zhao and Hao-Yu Shi and Xin-Yu Zhang and Peng Tan and Yang Yu and Zhi-Hua Zhou},
journal= {arXiv preprint arXiv:2505.13425},
year = {2025}
}