MoECollab:通过协作混合专家模型 democratizing 大语言模型开发
机器学习
2025-03-18 v1 人工智能
计算与语言
摘要
大语言模型(LLM)开发日益集中,限制了资源充足组织之外的参与。本文引入 MoECollab,一种新型框架,利用混合专家(Mixture of Experts,MoE)架构实现分布式、协作式的 LLM 开发。通过将单一模型分解为由可训练门控网络协调的专门化专家模块,本框架使不同贡献者无需计算资源即可参与。我们提供了完整的技术实现及数学基础,涵盖专家动态、门控机制及集成策略。实验表明,该方法在多个数据集上相较于基线模型实现 3-7% 的准确率提升,同时将计算需求降低 34%。专家专业化带来显著的领域特定收益,在一般分类任务中 F1 分数提升至 88%(原 51%),新闻分类准确率提升至 44%(原 23%)。我们正式化路由熵优化问题,证明恰当的正则化技术可使专家利用率提升 14%。这些结果验证了 MoECollab 作为通过架构支持协作 democratize LLM 开发的有效方法。
引用
@article{arxiv.2503.12592,
title = {MoECollab: Democratizing LLM Development Through Collaborative Mixture of Experts},
author = {Harshit},
journal= {arXiv preprint arXiv:2503.12592},
year = {2025}
}