用于多轮医疗访谈端到端语音识别的后解码器偏置
计算与语言
2024-03-04 v1 声音
音频与语音处理
摘要
端到端(E2E)方法正逐渐取代自动语音识别(ASR)任务中的混合模型。然而,E2E 模型的优化缺乏一种直观的方法来处理解码偏移,特别是在包含大量具有特定重要意义的领域特定稀有词的场景中。此外,学术界缺乏知识密集型语音数据集是一个显著的限制因素,且常用的语音语料库与现实对话存在显著差异。为应对这些挑战,我们提出了医疗访谈(MED-IT),这是一个包含大量知识密集型命名实体的多轮咨询语音数据集。我们还探索了增强 E2E 模型稀有词识别性能的方法。我们提出了一种新颖的方法,即后解码器偏置,该方法基于训练转录本的分布构建变换概率矩阵。这引导模型优先识别偏置列表中的单词。在我们的实验中,对于在训练语音中出现 10 至 20 次以及 1 至 5 次的稀有词子集,所提出的方法分别实现了 9.3% 和 5.1% 的相对提升。
引用
@article{arxiv.2403.00370,
title = {Post-decoder Biasing for End-to-End Speech Recognition of Multi-turn Medical Interview},
author = {Heyang Liu and Yu Wang and Yanfeng Wang},
journal= {arXiv preprint arXiv:2403.00370},
year = {2024}
}