基于 BERT 与图卷积网络的跨话语重排序模型用于会话语音识别
计算与语言
2021-10-04 v6 音频与语音处理
摘要
如何有效地将跨话语信息线索融入神经语言模型(LM)已成为自动语音识别(ASR)中引人关注的问题之一。现有提升 LM 上下文化的研究通常将先前话语视为额外输入的序列,可能难以捕捉这些话语间复杂的全局结构依赖。有鉴于此,本文试图将话语的历史上下文信息表示为图结构数据,以提取跨话语的全局词交互关系。为此,我们在所得图上应用图卷积网络(GCN)以获取历史词的相应 GCN 嵌入。GCN 近期在社交网络分析、文本摘要等方面发现了广泛用途,主要因其能有效捕捉元素间丰富的关联信息。然而,GCN 在 ASR 中仍鲜有探索,尤其在处理会话语音方面。此外,我们将 ASR N-best 重排序构建为预测问题,利用来自变换器的双向编码器表示(BERT)作为载体,不仅捕捉候选假设中固有的局部内在词规律模式,还融入由 GCN 提取的跨话语历史词交互线索以提升性能。在 AMI 基准数据集上开展的广泛实验似乎印证了我们的方法相较于若干当前顶尖方法的实用价值。
引用
@article{arxiv.2106.06922,
title = {Cross-utterance Reranking Models with BERT and Graph Convolutional Networks for Conversational Speech Recognition},
author = {Shih-Hsuan Chiu and Tien-Hong Lo and Fu-An Chao and Berlin Chen},
journal= {arXiv preprint arXiv:2106.06922},
year = {2021}
}
备注
6 pages, 5 figures, Accepted to APSIPA ASC 2021