实现 PB 级声学建模
声音
2019-04-25 v1 机器学习
音频与语音处理
机器学习
摘要
大规模机器学习(ML)系统,如 Alexa 自动语音识别(ASR)系统,随着人工转写训练数据量的增加而持续改进。我们不是将人工转写扩展到不切实际的水平,而是利用半监督学习(SSL)从海量未转写音频数据中学习声学模型(AM)。从 100 万小时音频中学习 AM 带来了独特的 ML 和系统设计挑战。我们提出了一个高度可扩展且资源高效的 SSL 声学建模系统的设计与评估。采用学生/教师学习范式,我们专注于学生学习子系统:一个从原始音频生成特征和目标的可扩展且鲁棒的数据流水线,以及一个高效的模型流水线,包括分布式训练器,用于构建学生模型。我们的评估表明,即使没有广泛的超参数调优,我们也获得了 10% 到 20% 范围内的相对准确率提升,在更嘈杂的条件下增益更高。该 SSL 系统的端到端处理时间为 12 天,并且该系统中的多个组件可以随更多计算资源线性扩展。
引用
@article{arxiv.1904.10584,
title = {Realizing Petabyte Scale Acoustic Modeling},
author = {Sree Hari Krishnan Parthasarathi and Nitin Sivakrishnan and Pranav Ladkat and Nikko Strom},
journal= {arXiv preprint arXiv:1904.10584},
year = {2019}
}
备注
2156-3357 \copyright 2019 IEEE. Personal use is permitted, but republication/redistribution requires IEEE permission. See http://www.ieee.org/publications standards/publications/rights/index.html for more information