SVD 与因子化 TDNN 方法在语音转文本中的比较
声音
2021-10-15 v1 计算与语言
音频与语音处理
摘要
本工作专注于降低混合 HMM-DNN 的 RTF 与词错率。我们的基线系统采用含 TDNN 与 LSTM 层的架构。我们发现该架构对轻度混响环境尤为有用。然而,这些模型往往比期望的耗费更多计算。本工作中,我们探索采用奇异值分解 (SVD) 应用于 TDNN 层以降低 RTF,并应用于每个 LSTM 单元的仿射变换的替代架构。我们将此方法与被指定为类似于 SVD 在训练前引入的瓶颈层进行比较。此外,我们缩减了解码图的搜索空间以使其更适配实时应用。我们报告了在 Fisher 数据及该数据集的混响版本上训练的架构相对 RTF 降低 61.57%,且 WER 相对下降近 1%,以匹配我们的一个目标测试分布。
引用
@article{arxiv.2110.07027,
title = {Comparison of SVD and factorized TDNN approaches for speech to text},
author = {Jeffrey Josanne Michael and Nagendra Kumar Goel and Navneeth K and Jonas Robertson and Shravan Mishra},
journal= {arXiv preprint arXiv:2110.07027},
year = {2021}
}
备注
4 pages, 1 figure, 3 tables