用于语音助手延迟降低的个性化预测式ASR
计算与语言
2023-05-24 v1 音频与语音处理
摘要
语音助手中的流式自动语音识别(ASR)可利用预取来部分隐藏响应生成的延迟。预取包括将初步的ASR假设传递给下游系统,以预取并缓存响应。若端点检测后的最终ASR假设与初步假设匹配,则可将缓存响应交付给用户,从而节省延迟。在本文中,我们通过引入预测式自动语音识别扩展该思想,即从部分观测的话语中预测完整话语,并基于预测话语预取响应。我们引入两种个性化方法,并考察成功预测带来的潜在延迟收益与失败预测所致成本增加之间的权衡。我们在内部语音助手数据集及公开SLURP数据集上评估了我们的方法。
引用
@article{arxiv.2305.13794,
title = {Personalized Predictive ASR for Latency Reduction in Voice Assistants},
author = {Andreas Schwarz and Di He and Maarten Van Segbroeck and Mohammed Hethnawi and Ariya Rastrow},
journal= {arXiv preprint arXiv:2305.13794},
year = {2023}
}
备注
Accepted for Interspeech 2023