基于对抗多任务学习的说话人与年龄不变儿童声学建模训练
声音
2022-11-08 v2 计算与语言
音频与语音处理
摘要
儿童语音声学建模的主要挑战之一是随着儿童成长其发音器官发生的快速变化、不同的生长速率以及同一年龄组中随后的高变异性。这些高声学变异加之儿童语音语料的稀缺,阻碍了可靠儿童语音识别系统的开发。本文提出了一种基于对抗多任务学习的说话人与年龄不变训练方法。该系统由一个生成器共享网络组成,该网络学习生成说话人与年龄不变特征,并连接到三个判别网络,分别用于音素、年龄和说话人。生成器网络以对抗多任务学习的方式训练,以最小化音素判别损失并最大化说话人与年龄判别损失。生成器网络为时间延迟神经网络(TDNN)架构,而三个判别器为前馈网络。该系统应用于OGI语音语料库,使ASR的词错率(WER)降低了13%。
引用
@article{arxiv.2210.10231,
title = {Speaker- and Age-Invariant Training for Child Acoustic Modeling Using Adversarial Multi-Task Learning},
author = {Mostafa Shahin and Beena Ahmed and Julien Epps},
journal= {arXiv preprint arXiv:2210.10231},
year = {2022}
}
备注
Submitted to ICASSP2023