中文

G-Augment:面向 ASR 的数据增强策略元结构搜索

机器学习 2022-10-26 v2 计算与语言 声音 音频与语音处理

摘要

数据增强是一种广泛用于提升自动语音识别(ASR)训练鲁棒性的技术。然而,尽管 ASR 训练流程的许多环节已实现自动化并更加“端到端”,数据增强策略(使用何种增强函数及如何应用)仍依赖人工设计。我们提出 Graph-Augment,一种将增强空间定义为有向无环图(DAGs)并在该空间上搜索以优化增强策略本身的技术。我们表明,在相同的计算预算下,G-Augment 生成的策略在 CHiME-6 和 AMI 的微调任务上优于通过随机搜索获得的 SpecAugment 策略。G-Augment 还能够在 CHiME-6 评估集上取得新的最优 ASR 性能(30.7% WER)。我们进一步证明,与随机搜索的 SpecAugment 策略相比,G-Augment 策略在从热启动到冷启动训练以及模型规模方面表现出更好的迁移特性。

关键词

引用

@article{arxiv.2210.10879,
  title  = {G-Augment: Searching for the Meta-Structure of Data Augmentation Policies for ASR},
  author = {Gary Wang and Ekin D. Cubuk and Andrew Rosenberg and Shuyang Cheng and Ron J. Weiss and Bhuvana Ramabhadran and Pedro J. Moreno and Quoc V. Le and Daniel S. Park},
  journal= {arXiv preprint arXiv:2210.10879},
  year   = {2022}
}

备注

6 pages, accepted at SLT 2022. Updated with copyright