中文

离散音频表示作为梅尔谱图在说话人与语音识别中的替代方案

音频与语音处理 2023-09-21 v1 声音

摘要

离散音频表示(又称音频分词)因有望促进文本语言建模方法在音频领域的应用而重新受到关注。为此,人们提出了多种基于压缩与表示学习的分词方案。然而,关于基于压缩的音频 token 相较于成熟的梅尔谱图特征,在各种说话人与语音相关任务上的表现,研究仍有限。本文中,我们在三项任务上评估基于压缩的音频 token:说话人验证、说话人日志化与(多语种)语音识别。我们的发现表明:(i) 以音频 token 训练的模型表现具竞争力,在所有考察任务上平均与梅尔谱图特征差距在 1%1\% 以内,且尚未超越后者;(ii) 这些模型对域外窄带数据表现出鲁棒性,尤其在说话人任务中;(iii) 音频 token 相较梅尔谱图特征可压缩至 20 倍,且在语音与说话人相关任务中性能损失极小,这对低比特率应用至关重要;(iv) 所考察的基于残差向量量化(RVQ)的音频分词器呈现低通频率响应特性,为观测结果提供了合理解释,并为未来分词器设计提供见解。

关键词

引用

@article{arxiv.2309.10922,
  title  = {Discrete Audio Representation as an Alternative to Mel-Spectrograms for Speaker and Speech Recognition},
  author = {Krishna C. Puvvada and Nithin Rao Koluguri and Kunal Dhawan and Jagadeesh Balam and Boris Ginsburg},
  journal= {arXiv preprint arXiv:2309.10922},
  year   = {2023}
}

备注

Preprint. Submitted to ICASSP 2024