中文

通过知识蒸馏实现高效交错语音建模

声音 2025-10-23 v2 计算与语言 音频与语音处理

摘要

当前语音语言模型超出许多部署环境的大小和延迟限制。我们通过层对齐蒸馏,匹配隐藏状态、注意力图和软化 logits,将大型多模态变压器压缩 3 倍且性能损失最小,构建紧凑、富有表达力的语音生成模型。我们引入 TinyWave,一套 20 亿参数的语音到语音和交错语音-文本生成模型,基于 50,000 小时的公共音频训练。TinyWave 支持(i)使用声学或表达标记进行语音-only 生成,(ii)语音-文本混合生成。Libri-Light 上的评估显示,TinyWave 的验证困惑度仅比其教师模型高出 1.4 个标准化困惑度点。关于 spoken StoryCloze 和 SALMon 的准确率达到教师模型 93-97%,超越规模匹配的基线。这些模型针对商品硬件进行优化,可支持实时对话智能体、辅助技术以及低资源环境的应用。我们发布模型、训练代码和评估脚本,以支持可重复的研究,聚焦紧凑、富有表达力的语音生成。

关键词

引用

@article{arxiv.2506.23670,
  title  = {Efficient Interleaved Speech Modeling through Knowledge Distillation},
  author = {Mohammadmahdi Nouriborji and Morteza Rohanian},
  journal= {arXiv preprint arXiv:2506.23670},
  year   = {2025}
}