中文

面向语音语言模型的神经音频编解码器探究

声音 2024-09-09 v1 音频与语音处理

摘要

神经音频编解码器标记是语音语言模型(SLM)基语音生成的基本构件。然而,目前缺乏对编解码器系统如何影响 SLM 生成性能的系统性理解。本文在 SLM 框架中考察编解码器标记,旨为有效编解码器设计提供见解。我们在相同数据集和损失函数下重新训练既有高性能神经编解码器模型,以统一设置进行性能比较。我们将编解码器标记集成到两种 SLM 系统中:基于掩码的并行语音生成系统和基于自回归(AR)加非自回归(NAR)模型的系统。我们的发现表明,编解码器系统中更优的语音重建并不一定保证 SLM 中语音生成性能提升。在 SLM 中,高质量编解码器解码器对于实现自然语音至关重要,而语音可懂性则更依赖于量化机制。

关键词

引用

@article{arxiv.2409.04016,
  title  = {Investigating Neural Audio Codecs for Speech Language Model-Based Speech Generation},
  author = {Jiaqi Li and Dongmei Wang and Xiaofei Wang and Yao Qian and Long Zhou and Shujie Liu and Midia Yousefi and Canrun Li and Chung-Hsien Tsai and Zhen Xiao and Yanqing Liu and Junkun Chen and Sheng Zhao and Jinyu Li and Zhizheng Wu and Michael Zeng},
  journal= {arXiv preprint arXiv:2409.04016},
  year   = {2024}
}

备注

Accepted by SLT-2024