中文

BitTTS: 通过 1.58 位量化与权重索引实现高度紧凑的文本到语音合成

音频与语音处理 2025-06-05 v1 机器学习 声音 信号处理

摘要

本文提出了一种高度紧凑、轻量级的文本到语音(TTS)模型,适用于设备端应用。为减小模型规模,该模型引入了两种技术。第一,我们提出量化感知训练(QAT),在训练期间将模型参数量化至低至 1.58 位。在此情况下,大多数 32 位模型参数被量化为三值 {-1, 0, 1}。第二,我们提出一种名为权重索引的方法。在该方法中,我们将一组 1.58 位权重保存为单个 int8 索引。这使得即使在以 8 位为单位处理数值的硬件上也能高效存储模型参数。实验结果表明,所提方法实现了 83% 的模型规模缩减,同时在合成质量上超越了同等规模但未量化的基线模型。

关键词

引用

@article{arxiv.2506.03515,
  title  = {BitTTS: Highly Compact Text-to-Speech Using 1.58-bit Quantization and Weight Indexing},
  author = {Masaya Kawamura and Takuya Hasumi and Yuma Shirahata and Ryuichi Yamamoto},
  journal= {arXiv preprint arXiv:2506.03515},
  year   = {2025}
}

备注

Accepted to INTERSPEECH 2025