中文

FlexOlmo:支持灵活数据使用的开放语言模型

计算与语言 2025-08-26 v4 人工智能

摘要

我们介绍了FlexOlmo,一种新型语言模型(LM),它支持(1)无需数据共享的分布式训练,其中不同的模型参数在封闭数据集上独立训练,以及(2)数据灵活的推理,其中这些参数及其关联数据可以灵活地包含或排除在模型推理之外,无需进一步训练。FlexOlmo采用混合专家(MoE)架构,每个专家在封闭数据集上独立训练,随后通过一种新的基于领域信息的路由进行集成,无需任何联合训练。FlexOlmo在FlexMix上训练,这是我们整理的一个语料库,包含公开可用的数据集以及七个特定领域的数据集,代表了封闭数据集的现实近似。我们在31个多样化的下游任务上评估了参数多达370亿(200亿活跃)的模型。我们表明,在公共数据上训练的通用专家可以与其他数据拥有者独立训练的专家有效结合,平均相对改进达到41%,同时允许用户根据数据许可或权限要求选择退出某些数据。我们的方法在平均性能上也比先前的模型合并方法高出10.1%,并超越了使用相同训练FLOPs、无数据限制训练的标准MoE。总之,这项研究为数据拥有者和受监管行业中处理敏感或受保护数据的研究人员提供了一种解决方案。FlexOlmo使得能够从封闭数据中获益,同时通过保持数据本地化并在推理期间支持对数据访问的细粒度控制,尊重数据拥有者的偏好。

关键词

引用

@article{arxiv.2507.07024,
  title  = {FlexOlmo: Open Language Models for Flexible Data Use},
  author = {Weijia Shi and Akshita Bhagia and Kevin Farhat and Niklas Muennighoff and Pete Walsh and Jacob Morrison and Dustin Schwenk and Shayne Longpre and Jake Poznanski and Allyson Ettinger and Daogao Liu and Margaret Li and Dirk Groeneveld and Mike Lewis and Wen-tau Yih and Luca Soldaini and Kyle Lo and Noah A. Smith and Luke Zettlemoyer and Pang Wei Koh and Hannaneh Hajishirzi and Ali Farhadi and Sewon Min},
  journal= {arXiv preprint arXiv:2507.07024},
  year   = {2025}
}