增强与对抗:利用说话人标签改进 ASR
音频与语音处理
2023-10-19 v2 计算与语言
机器学习
声音
摘要
ASR 可以通过结合领域增强或领域对抗训练的多任务学习(MTL)来改进,这是两个相反的目标,分别旨在增加/减少领域方差,以实现领域感知/领域不可知的 ASR。在这项工作中,我们研究了如何最好地利用说话人标签应用这两个相反的目标,以改进基于 Conformer 的 ASR。我们还提出了一种新颖的自适应梯度反转层,用于在没有调参工作量的情况下实现稳定有效的对抗训练。我们进行了详细的分析和实验验证,以展示在 ASR 神经网络(NN)中应用说话人增强和对抗训练的最佳位置。我们还探索了它们的组合以进一步提高性能,达到了与 i-vectors 加对抗训练相同的性能。我们最好的基于说话人的 MTL 在 Switchboard Hub5'00 集上实现了 7\% 的相对改进。我们还研究了这种基于说话人的 MTL 在更干净的数据集和较弱的 ASR NN 上的效果。
引用
@article{arxiv.2211.06369,
title = {Enhancing and Adversarial: Improve ASR with Speaker Labels},
author = {Wei Zhou and Haotian Wu and Jingjing Xu and Mohammad Zeineldeen and Christoph Lüscher and Ralf Schlüter and Hermann Ney},
journal= {arXiv preprint arXiv:2211.06369},
year = {2023}
}
备注
accepted at ICASSP 2023