中文

参数化与非参数化CNN原始波形声学模型的音素错误分析

声音 2024-06-04 v1 计算与语言 音频与语音处理

摘要

在本文中,我们分析了原始波形声学模型在TIMIT音素识别任务中的错误模式。我们的分析超越了传统的音素错误率(PER)指标。我们将音素分为三组:{塞擦音、双元音、擦音、鼻音、塞音、半元音、元音、静音}、{辅音、元音+、静音}和{浊音、清音、静音},并计算每个类别中每个广义语音类别的PER。我们还为每个类别构建了混淆矩阵,使用替换错误,并将混淆模式与Filterbank和Wav2vec 2.0系统的混淆模式进行了比较。我们的原始波形声学模型由参数化(Sinc2Net)或非参数化CNN和双向LSTM组成,在TIMIT开发集/测试集上实现了低至13.7%/15.2%的PER,优于文献中报道的原始波形模型的PER。我们还研究了来自WSJ的迁移学习对音素错误模式和混淆矩阵的影响。它将开发集/测试集上的PER降低到了11.8%/13.7%。

关键词

引用

@article{arxiv.2406.00898,
  title  = {Phonetic Error Analysis of Raw Waveform Acoustic Models with Parametric and Non-Parametric CNNs},
  author = {Erfan Loweimi and Andrea Carmantini and Peter Bell and Steve Renals and Zoran Cvetkovic},
  journal= {arXiv preprint arXiv:2406.00898},
  year   = {2024}
}

备注

5 pages, 6 figures, 3 tables