中文

基于卷积变分自编码器的语谱压缩用于自动语音识别

声音 2024-10-07 v2 计算与语言 音频与语音处理

摘要

对于许多自动语音识别(ASR)任务,语谱图作为音频特征比梅尔频率倒数系数(MFCC)显示更好的效果,但在实际应用中由于特征空间的复杂维度而难以使用。本文提出一种基于卷积变分自编码器(Convolutional VAE)的生成压缩语谱表示的方法。对LibriSpeech数据集的子样本进行训练,以重建来自13维嵌入的短音频语谱片段(25 ms)。在40维(300 ms)嵌入上训练的模型用于生成GoogleSpeechCommands数据集上 spoken commands 语料库的特征。使用生成的特征构建的ASR系统与使用MFCC特征的模型进行了比较。

关键词

引用

@article{arxiv.2410.02560,
  title  = {Convolutional Variational Autoencoders for Spectrogram Compression in Automatic Speech Recognition},
  author = {Olga Iakovenko and Ivan Bondarenko},
  journal= {arXiv preprint arXiv:2410.02560},
  year   = {2024}
}

备注

Theory and Practice of Natural Computing 9th International Conference, TPNC 2020, Taoyuan, Taiwan, 2020, Proceedings 9