中文

基于分区梯度匹配的数据子集选择以实现计算高效的鲁棒 ASR 训练

机器学习 2022-11-01 v1

摘要

训练诸如 RNN-T 等最先进的 ASR 系统通常伴随高昂的经济与环境成本。若所选子集能以与全数据集训练相当的性能训练,则使用训练数据子集可缓解此问题。尽管存在许多数据子集选择(DSS)算法,但直接应用于 RNN-T 是困难的,尤其是那些自适应并利用如梯度等学习动态的 DSS 算法,因为 RNN-T 的梯度往往具有显著更大的内存占用。在本文中,我们提出分区梯度匹配(PGM),一种新颖的可分布式 DSS 算法,适用于如用于训练 RNN-T 的大规模数据集。通过在 Librispeech 100H 与 Librispeech 960H 上的大量实验,我们表明 PGM 实现了 3 倍至 6 倍的加速,且仅带来极小的精度下降(绝对 WER 差异低于 1%)。此外,我们展示了即使在训练数据被噪声污染的设定下,PGM 也取得类似结果。

关键词

引用

@article{arxiv.2210.16892,
  title  = {Partitioned Gradient Matching-based Data Subset Selection for Compute-Efficient Robust ASR Training},
  author = {Ashish Mittal and Durga Sivasubramanian and Rishabh Iyer and Preethi Jyothi and Ganesh Ramakrishnan},
  journal= {arXiv preprint arXiv:2210.16892},
  year   = {2022}
}