域对抗神经网络用于构音障碍语音识别
机器学习
2022-04-22 v5 机器学习
摘要
语音识别系统在过去几年中取得了显著改进,然而,对于口音或受损语音的情况,其性能会显著下降。本工作探索了域对抗神经网络(DANN)在 UAS 构音障碍语音数据集上用于说话人无关的语音识别。对 10 个口语数字的的分类任务使用以原始音频为输入的端到端 CNN 执行。结果相较于说话人自适应(SA)模型以及说话人相关(SD)与多任务学习(MTL)模型进行了比较。本文开展的实验表明 DANN 取得了 74.91% 的绝对识别率,并以 12.18% 优于基线。此外,DANN 模型取得了与 SA 模型 77.65% 识别率相当的结果。我们还观察到,当有标记的构音障碍语音数据可用时 DANN 与 MTL 表现相似,但当它们不可用时 DANN 优于 MTL。
引用
@article{arxiv.2010.03622,
title = {Theoretical Analysis of Self-Training with Deep Networks on Unlabeled Data},
author = {Colin Wei and Kendrick Shen and Yining Chen and Tengyu Ma},
journal= {arXiv preprint arXiv:2010.03622},
year = {2022}
}
备注
Published at ICLR 2021