剖析端侧端到端语音识别中的用户感知延迟
声音
2021-08-13 v3 计算与语言
音频与语音处理
摘要
随着智能手机和智能音箱等支持语音的设备日益普及,人们对能够直接在设备上运行的自动语音识别(ASR)系统的兴趣与日俱增;循环神经网络转导器及其变体等端到端(E2E)语音识别模型最近已成为该任务的主要候选方案。除了准确且紧凑之外,此类系统还需要以较低的用户感知延迟(UPL)解码语音,在说出单词的同时生成相应文本。本工作考察了各种技术——模型架构、训练准则、解码超参数和端点检测参数——对 UPL 的影响。我们的分析表明,模型规模(参数量、输入分块大小)的度量,或反映模型处理输入帧能力的计算量度量(例如 FLOPS、RTF),并不总是与观测到的 UPL 强相关。因此,传统的算法延迟度量可能不足以准确刻画模型部署在嵌入式设备时所观测到的延迟。相反,我们发现影响词元发射延迟和端点检测行为的因素对 UPL 影响更大。当将 ASR 与端点检测联合执行,同时利用最近提出的对齐正则化机制时,我们实现了延迟与词错误率之间的最佳权衡。
引用
@article{arxiv.2104.02207,
title = {Dissecting User-Perceived Latency of On-Device E2E Speech Recognition},
author = {Yuan Shangguan and Rohit Prabhavalkar and Hang Su and Jay Mahadeokar and Yangyang Shi and Jiatong Zhou and Chunyang Wu and Duc Le and Ozlem Kalinli and Christian Fuegen and Michael L. Seltzer},
journal= {arXiv preprint arXiv:2104.02207},
year = {2021}
}
备注
Proc. of Interspeech 2021