离散音频表示作为梅尔谱图在说话人与语音识别中的替代方案
音频与语音处理
2023-09-21 v1 声音
摘要
离散音频表示(又称音频分词)因有望促进文本语言建模方法在音频领域的应用而重新受到关注。为此,人们提出了多种基于压缩与表示学习的分词方案。然而,关于基于压缩的音频 token 相较于成熟的梅尔谱图特征,在各种说话人与语音相关任务上的表现,研究仍有限。本文中,我们在三项任务上评估基于压缩的音频 token:说话人验证、说话人日志化与(多语种)语音识别。我们的发现表明:(i) 以音频 token 训练的模型表现具竞争力,在所有考察任务上平均与梅尔谱图特征差距在 以内,且尚未超越后者;(ii) 这些模型对域外窄带数据表现出鲁棒性,尤其在说话人任务中;(iii) 音频 token 相较梅尔谱图特征可压缩至 20 倍,且在语音与说话人相关任务中性能损失极小,这对低比特率应用至关重要;(iv) 所考察的基于残差向量量化(RVQ)的音频分词器呈现低通频率响应特性,为观测结果提供了合理解释,并为未来分词器设计提供见解。
引用
@article{arxiv.2309.10922,
title = {Discrete Audio Representation as an Alternative to Mel-Spectrograms for Speaker and Speech Recognition},
author = {Krishna C. Puvvada and Nithin Rao Koluguri and Kunal Dhawan and Jagadeesh Balam and Boris Ginsburg},
journal= {arXiv preprint arXiv:2309.10922},
year = {2023}
}
备注
Preprint. Submitted to ICASSP 2024