中文

MiniMind-O 技术报告:一个开源的小规模语音原生全模态模型

声音 2026-05-06 v1 多媒体 音频与语音处理

摘要

MiniMind-O 是一个基于 MiniMind 语言模型构建的开源 0.1B 规模全模态模型。它接受文本、语音和图像输入,并返回文本与流式语音。此次发布包括模型代码、检查点,以及用于文本到音频、图像到文本和音频到音频训练的主要 Parquet 训练数据集,使得完整的交互循环可直接被检查。该模型使用完整的 MiniMind 主干作为 Thinker,以及一个由 MiniMind 模块构成的独立四层 Talker。冻结的 SenseVoice-Small 和 SigLIP2 编码器提供语音和图像特征,这些特征通过轻量级 MLP 投影器进行映射,并注入到模态占位符位置。Talker 读取中间层 Thinker 状态以及自回归的八层 Mimi 码缓冲区。说话人控制由专门的说话人 token、右对齐的参考编解码器提示和预计算的 CAM++ 说话人嵌入处理,因此语音条件化仍是音频码上下文的一部分,而不是一个单独的 TTS 模块。使用 768 维的 Talker,密集变体和 MoE 变体在 Thinker-Talker 一致性评估中分别达到了 0.0897 和 0.0900 的平均 CER,总体语音克隆相似度分别为 0.5995 和 0.5937。除了报告一个可运行的系统外,本文还指出了小型全模态模型的三个规模关键设计选择:中间层语义桥接、已发布的多模态序列格式,以及参数高效的八码本接口。

关键词

引用

@article{arxiv.2605.03937,
  title  = {MiniMind-O Technical Report: An Open Small-Scale Speech-Native Omni Model},
  author = {Jingyao Gong},
  journal= {arXiv preprint arXiv:2605.03937},
  year   = {2026}
}

备注

17 pages. Code, checkpoints, and training data are available at https://github.com/jingyaogong/minimind-o