面向虚拟助手的口语实体中心知识查询的服务端重打分
计算与语言
2023-11-03 v1 声音
音频与语音处理
摘要
由自动语音识别(ASR)赋能的端侧虚拟助手(VA)需要有效的知识整合以应对具有挑战性的富实体查询识别。在本文中,我们使用各类语言模型(LM)(N-gram 词 LM、子词神经 LM)对口语信息域查询的服务端重打分建模策略进行了实证研究。我们研究了端侧与服务端信号的结合,并表明与仅执行端侧 ASR 相比,通过集成各种服务端 LM,在各实体中心查询子群体上实现了 23%–35% 的显著词错误率(WER)改进。我们还对基于领域数据训练的 LM 与 OpenAI 提供的 GPT-3 变体作为基线进行了比较。此外,我们还表明,从头训练的多个服务端 LM 的模型融合最有效地结合了各模型的互补优势,并将从领域特定数据中学到的知识集成到 VA ASR 系统中。
引用
@article{arxiv.2311.01398,
title = {Server-side Rescoring of Spoken Entity-centric Knowledge Queries for Virtual Assistants},
author = {Youyuan Zhang and Sashank Gondala and Thiago Fraga-Silva and Christophe Van Gysel},
journal= {arXiv preprint arXiv:2311.01398},
year = {2023}
}