中文

面向实时手机端 TTS 的 T-Mimi:基于 Transformer 的 Mimi 解码器

音频与语音处理 2026-01-29 v1

摘要

神经音频编解码器为语音合成提供了有前景的声学特征,其中代表性的流式编解码器如 Mimi 可为实时文本到语音(TTS)应用提供高质量声学特征。然而,Mimi 的解码器采用混合 Transformer 和卷积架构,由于解卷积层计算密集,对于移动 CPU(如最主流的框架 XNNPACK)不够友好,导致引入显著的延迟瓶颈。本文提出 T-Mimi,一种改造 Mimi 编解码器解码器的新方法,用纯 Transformer 解码器取代其卷积组件,灵感来自 TS3-Codec 架构。此变更显著降低了设备端 TTS 延迟,从 42.1ms 降低至仅 4.4ms。此外,我们进行了量化感知训练并得出关键发现:距离波形最近的解码器最后两层 Transformer 层和随后的线性层对量化极其敏感,必须保持全精度以维持音频质量。

关键词

引用

@article{arxiv.2601.20094,
  title  = {T-Mimi: A Transformer-based Mimi Decoder for Real-Time On-Phone TTS},
  author = {Haibin Wu and Bach Viet Do and Naveen Suda and Julian Chan and Madhavan C R and Gene-Ping Yang and Yi-Chiao Wu and Naoyuki Kanda and Yossef Adi and Xin Lei and Yue Liu and Florian Metze and Yuzong Liu},
  journal= {arXiv preprint arXiv:2601.20094},
  year   = {2026}
}

备注

Accepted by ICASSP 2026