面向短搜索查询的大规模端到端模型
音频与语音处理
2023-09-25 v1 声音
摘要
在这项工作中,我们研究了两种流行的端到端自动语音识别(ASR)模型,即连接主义时序分类(CTC)和 RNN-转导器(RNN-T),用于语音搜索查询的离线识别,模型参数多达 2B。我们模型的编码器采用 Google 通用语音模型(USM)的神经网络架构,并附加漏斗池化层以显著降低帧率并加速训练和推理。我们就词汇表大小、时间缩减策略及其在长音频测试集上的泛化性能进行了广泛研究。尽管有推测认为,随着模型规模增大,CTC 可以做得和将标签依赖构建到预测中的 RNN-T 一样好,但我们观察到 900M 的 RNN-T 明显优于 1.8B 的 CTC,并且对严重的时间缩减更具容忍度,尽管通过 LM 浅融合可以在很大程度上消除 WER 差距。
引用
@article{arxiv.2309.12963,
title = {Massive End-to-end Models for Short Search Queries},
author = {Weiran Wang and Rohit Prabhavalkar and Dongseong Hwang and Qiujia Li and Khe Chai Sim and Bo Li and James Qin and Xingyu Cai and Adam Stooke and Zhong Meng and CJ Zheng and Yanzhang He and Tara Sainath and Pedro Moreno Mengibar},
journal= {arXiv preprint arXiv:2309.12963},
year = {2023}
}