中文

米米尔:大规模多语言概念建模

计算与语言 2026-05-26 v1 人工智能

摘要

当前语言建模方法围绕 token 进行构建。文本语料被划分为 token,模型通过对这些 token 执行计算来训练,如根据前文预测下一个 token。尽管如此,token 基方法尤其鉴于其在现代语言建模中取得的卓越性能,仍引人深思。近期研究不仅开始质疑语言模型如何从 token 中处理和理解意义,还质疑是否可以使用更高的粒度来推动研究领域的进步。这引导我们考虑概念建模,即直接训练用于下一个概念预测的模型,而非下一个 token 预测。其目标是将输入从 token 变为概念,迫使底层语言模型将其粒度从细粒度 token 转向宽泛概念。本文介绍米米尔 (Mimir),一个 16 亿参数的大型概念模型,用于多语言概念理解与生成。我们利用规模为 388 亿句子、覆盖 46 种语言的大规模多语言预训练语料,以及规模为 66 亿句子、覆盖 35 种语言的大规模多轮多语言指令微调数据集。我们对模型性能进行了广泛评估,与参数数量相当的语言模型进行了比较。

关键词

引用

@article{arxiv.2605.25263,
  title  = {Mimir: Large-scale Multilingual Concept Modeling},
  author = {Elio Musacchio and Lucia Siciliani and Pierpaolo Basile},
  journal= {arXiv preprint arXiv:2605.25263},
  year   = {2026}
}