HDEE:异构领域专家集合
机器学习
2025-02-27 v1 分布式、并行与集群计算
摘要
训练密集型大语言模型需要巨大的数据和集中计算资源,这引入了对中心化的基本瓶颈和不断增长的成本。several 研究旨在通过减少训练稠密模型的通信开销来减少对中心化依赖。将这种减少通信开销的理念自然地延伸到通过训练互惠的并行专家集合来实现密集模型的训练,已显示优于在传统集中设置下训练的大型稠密模型。然而,既有研究并未考虑数据领域之间的底层差异, treats them as monolithic, regardless of their underlying complexity, size, or distribution。本文我们探讨了引入异构性对这些领域专家模型集合的影响。具体而言,通过允许集合中的模型在大小上有所不同——以及根据训练数据的领域采取不同的训练步数——我们研究了异构性对这些集合在评估包含在训练集内和外的领域时的效果。我们使用相同的计算预算来训练异构集合和同质基准进行比较。我们显示,异构集合在使用 21 个评估数据域中 20 个域上的 perplexity 分数最低。我们的代码可在 https://github.com/gensyn-ai/hdee 获取。
关键词
引用
@article{arxiv.2502.19385,
title = {HDEE: Heterogeneous Domain Expert Ensemble},
author = {Oğuzhan Ersoy and Jari Kolehmainen and Gabriel Passamani Andrade},
journal= {arXiv preprint arXiv:2502.19385},
year = {2025}
}