北冥坞:一个学件坞系统
软件工程
2024-01-29 v1 密码学与安全
机器学习
摘要
周志华 [2016] 提出的学件范式旨在使用户能够复用大量已有的训练好的模型,而不是从头开始构建机器学习模型,以期解决超出模型原始用途的新用户任务。在此范式中,全球开发者可以自发地将其高性能模型提交到学件坞系统(以前称为学件市场),而无需泄露其训练数据。一旦坞系统接受该模型,它会分配一个规约并容纳该模型。此规约使得模型能够被充分识别和组装,以便根据未来用户的需求进行复用,即使他们对该模型没有先验知识。这种范式与当前的大模型方向有很大不同,并且可以预期,一个容纳数百万或更多高性能模型的学件坞系统,可以为大模型适用的计划内任务,以及大模型不存在或不适用的小型、专门化、数据敏感场景提供卓越的能力。本文描述了北冥坞,这是第一个开源的学件坞系统,为学件范式的未来研究提供了基础性支持。得益于其集成的架构和引擎设计、广泛的工程实现与优化,以及用于学件识别和复用的多种算法的集成,该系统显著简化了新用户任务的模型开发。值得注意的是,即使对于数据有限且机器学习专业知识极少的用户,这也是可能的,同时不会损害原始数据的安全性。北冥坞支持学件范式的整个过程。该系统为学件相关算法和系统的未来研究奠定了基础,并为托管海量学件和建立学件生态系统做好了准备。
引用
@article{arxiv.2401.14427,
title = {Beimingwu: A Learnware Dock System},
author = {Zhi-Hao Tan and Jian-Dong Liu and Xiao-Dong Bi and Peng Tan and Qin-Cheng Zheng and Hai-Tian Liu and Yi Xie and Xiao-Chuan Zou and Yang Yu and Zhi-Hua Zhou},
journal= {arXiv preprint arXiv:2401.14427},
year = {2024}
}