通过可检索语音 - 文本嵌入实现高精度语音搜索查询修正
计算与语言
2024-01-10 v1 声音
音频与语音处理
摘要
自动语音识别(ASR)系统可能因各种原因遭受召回率低的问题,例如音频噪声、训练数据不足等。先前的工作表明,通过在 ASR 假设文本的嵌入与待修正的候选修正项的嵌入之间进行最近邻搜索,从大量可能的、上下文相关的替代文本数据库中检索重写候选项,可以提高召回率。然而,如果文本假设与真实转录在语音上差异过大,基于 ASR 假设的检索可能会导致精度低下。在本文中,我们通过直接使用源自话语音频的嵌入来查询修正数据库,从而消除了假设音频不匹配的问题;话语音频和候选修正项的嵌入由多模态语音 - 文本嵌入网络生成,这些网络经过训练,能够将话语音频的嵌入与其对应文本转录的嵌入置于相近位置。在使用最近邻搜索定位到合适的修正候选项后,我们在将其添加到原始 n-best 列表之前,根据其语音 - 文本嵌入距离对该候选项进行评分。我们表明,对于转录出现在候选集中的话语,相对词错误率(WER)降低了 6%,同时并未增加一般话语的 WER。
引用
@article{arxiv.2401.04235,
title = {High-precision Voice Search Query Correction via Retrievable Speech-text Embedings},
author = {Christopher Li and Gary Wang and Kyle Kastner and Heng Su and Allen Chen and Andrew Rosenberg and Zhehuai Chen and Zelin Wu and Leonid Velikovich and Pat Rondon and Diamantino Caseiro and Petar Aleksic},
journal= {arXiv preprint arXiv:2401.04235},
year = {2024}
}