用于LF-MMI训练的时延神经网络神经架构搜索
音频与语音处理
2022-03-30 v3 声音
摘要
最先进的自动语音识别(ASR)系统开发需要大量数据和计算。这些系统的深度神经网络(DNNs)的最优设计通常需要专家知识和经验评估。本文使用一系列神经架构搜索(NAS)技术自动学习因子化时延神经网络(TDNN-Fs)的两类超参数:i) 左右拼接上下文偏移;ii) 每层隐藏层瓶颈线性投影的维度。这些技术包括将架构学习与无栅格MMI训练集成的可微神经架构搜索(DARTS)方法;减少候选架构混淆并改善架构选择泛化的Gumbel-Softmax和流水线DARTS方法;以及结合资源约束以平衡性能与系统复杂度权衡的惩罚DARTS。TDNN-F架构间的参数共享允许在多达7^28个不同系统中进行高效搜索。在具备速度扰动、i-Vector和基于学习隐单元贡献(LHUC)的说话人自适应以及RNNLM重打分的最先进300小时Switchboard语料库训练的LF-MMI TDNN-F基线系统上,获得了高达1.2%绝对词错误率(WER)的显著降低和31%的相对模型规模缩减。在相同任务上与文献中近期端到端系统的性能对比表明,最佳NAS自动配置系统在NIST Hub5'00和Rt03s测试集上分别取得了9.9%和11.1%的最先进WER,模型规模缩减高达96%。使用贝叶斯学习的进一步分析表明……
引用
@article{arxiv.2201.03943,
title = {Neural Architecture Search For LF-MMI Trained Time Delay Neural Networks},
author = {Shoukang Hu and Xurong Xie and Mingyu Cui and Jiajun Deng and Shansong Liu and Jianwei Yu and Mengzhe Geng and Xunying Liu and Helen Meng},
journal= {arXiv preprint arXiv:2201.03943},
year = {2022}
}
备注
Accepted by IEEE/ACM Transactions on Audio, Speech and Language Processing (TASLP). arXiv admin note: text overlap with arXiv:2007.08818