通过在协作学习环境的模拟课堂音频录音上训练实现西班牙语与英语音素识别
音频与语音处理
2022-02-23 v1 声音
摘要
协作学习环境的音频录音包含持续的交谈声与背景噪声。这些环境需要西班牙语与英语之间的动态语音识别。为消除对大规模真值的标准需求,本论文通过将音频转写转换为音素,并利用3D说话人几何与数据增强来生成西班牙语和英语语音的声学模拟,从而开发了一个模拟数据集。本论文开发了一个用于识别西班牙语和英语音素的低复杂度神经网络(可在 github.com/muelitas/keywordRec 获取)。当在41个英语音素上训练时,在Speech Commands上达到0.099的PER。当在36个西班牙语音素上训练并测试于协作学习环境的真实录音时,达到0.7208的LER。略优于Google的语音转文本0.7272 LER,后者使用的参数数量多出15至1,635倍,并在300至27,500小时真实数据上训练,而非13小时模拟音频。
引用
@article{arxiv.2202.10536,
title = {Spanish and English Phoneme Recognition by Training on Simulated Classroom Audio Recordings of Collaborative Learning Environments},
author = {Mario Esparza},
journal= {arXiv preprint arXiv:2202.10536},
year = {2022}
}