中文

通过学习音文本跨模态上下文表示进行对话语音识别

声音 2024-04-30 v2 计算与语言 音频与语音处理

摘要

对话场景下的自动语音识别(ASR)带来独特挑战,包括从先前的对话轮次中提取相关上下文信息。由于无关内容、错误传播与冗余,现有方法难以提取更长且更有效的上下文。为解决此问题,我们引入了一种新颖的对话ASR系统,以跨模态对话表示扩展Conformer编码器-解码器模型。我们的方法利用跨模态提取器,通过专用编码器和模态级掩码输入结合预训练的语音与文本模型。这使得无需显式错误传播即可提取更丰富的历史语音上下文。我们还引入条件隐变量模块以学习对话级属性,如角色偏好与话题连贯性。通过将跨模态与对话表示均引入解码器,我们的模型在更长句子中保留上下文而无信息损失,相较于标准Conformer模型,在 Mandarin 对话数据集HKUST与MagicData-RAMC上分别取得8.8%与23%的相对准确率提升。

关键词

引用

@article{arxiv.2310.14278,
  title  = {Conversational Speech Recognition by Learning Audio-textual Cross-modal Contextual Representation},
  author = {Kun Wei and Bei Li and Hang Lv and Quan Lu and Ning Jiang and Lei Xie},
  journal= {arXiv preprint arXiv:2310.14278},
  year   = {2024}
}

备注

TASLP