面向多语言低资源语音识别的对抗元采样
计算与语言
2021-04-13 v3 声音
音频与语音处理
摘要
低资源自动语音识别(ASR)具有挑战性,因为低资源目标语言数据无法很好地训练 ASR 模型。为解决此问题,元学习将每种源语言的 ASR 构建为许多小型 ASR 任务,并在来自不同源语言的所有任务上元学习一个模型初始化,以实现对未见目标语言的快速适配。然而,对于不同源语言,由于其数据规模与音系系统的差异,数量与难度差异巨大,这导致了任务数量与任务难度不平衡问题,从而使多语言元学习 ASR(MML-ASR)失败。本工作中,我们通过提出一种新颖的对抗元采样(AMS)方法来改进 MML-ASR 以解决该问题。在 MML-ASR 中采样任务时,AMS 自适应地确定每种源语言的任务采样概率。具体而言,对于每种源语言,若查询损失较大,则意味着其任务在数量与难度方面未被很好地采样以训练 ASR 模型,从而应更频繁地采样以进行额外学习。受此事实启发,我们将所有源语言域的历史任务查询损失输入一个网络,以学习一种对抗性地增大 MML-ASR 当前查询损失的任务采样策略。因此,所学得的任务采样策略能够掌握每种语言的学习情况,从而预测出每种语言的良好任务采样概率以实现更有效学习。最后,在两个多语言数据集上的实验结果表明,将我们的 AMS 应用于 MML-ASR 时性能显著提升,并证明了 AMS 对其他低资源语音任务及迁移学习 ASR 方法的适用性。
引用
@article{arxiv.2012.11896,
title = {Adversarial Meta Sampling for Multilingual Low-Resource Speech Recognition},
author = {Yubei Xiao and Ke Gong and Pan Zhou and Guolin Zheng and Xiaodan Liang and Liang Lin},
journal= {arXiv preprint arXiv:2012.11896},
year = {2021}
}
备注
accepted in AAAI2021