中文

Flexi-Transducer:针对多域端侧场景优化延迟、准确率与计算量

声音 2021-04-07 v1 计算与语言 音频与语音处理

摘要

通常,嵌入式设备的存储和计算约束要求单个端侧ASR模型服务于多个用例/域。在本文中,我们提出了一种用于端侧自动语音识别的灵活转导器(Flexible Transducer,FlexiT),以灵活处理具有不同准确率和延迟需求的多个用例/域。具体而言,使用单个紧凑模型,FlexiT为语音命令提供快速响应,并为听写提供准确转录但具有更高延迟。为实现灵活且更好的准确率和延迟权衡,使用了以下技术。首先,我们提出对Emformer编码器的段大小进行域特定改变,使FlexiT实现灵活解码。其次,我们使用对齐受限RNNT损失来实现对不同域的令牌发射延迟的灵活细粒度控制。最后,我们添加域指示向量作为FlexiT模型的额外输入。使用这些技术的组合,我们展示了可使用单个模型改善听写场景的WER和实时因子,同时保持语音命令用例的最佳延迟。

关键词

引用

@article{arxiv.2104.02232,
  title  = {Flexi-Transducer: Optimizing Latency, Accuracy and Compute forMulti-Domain On-Device Scenarios},
  author = {Jay Mahadeokar and Yangyang Shi and Yuan Shangguan and Chunyang Wu and Alex Xiao and Hang Su and Duc Le and Ozlem Kalinli and Christian Fuegen and Michael L. Seltzer},
  journal= {arXiv preprint arXiv:2104.02232},
  year   = {2021}
}

备注

Submitted to Interspeech 2021 (under review)