通过音素序列与 ASR 假设间交叉注意力构建鲁棒口语理解
计算与语言
2022-03-24 v1 声音
音频与语音处理
摘要
构建对自动语音识别(ASR)错误鲁棒的口语理解(SLU)是各类语音虚拟助手的关键问题。考虑到大多数 ASR 错误由相似发音表达间的语音混淆引起,直观上,利用语音的音素序列可补充 ASR 假设并增强 SLU 的鲁棒性。本文提出一种带交叉注意力的 SLU 新模型(记作 CASLU)。设计交叉注意力块以捕捉音素与词嵌入间的细粒度交互,从而使联合表示同时捕获输入的语音与语义特征,并克服下游自然语言理解(NLU)任务中的 ASR 错误。在三个数据集上进行了充分实验,显示了我们方法的有效性与竞争力。此外,我们也验证了 CASLU 的通用性,并证明其在与其他鲁棒 SLU 技术结合时的互补性。
引用
@article{arxiv.2203.12067,
title = {Building Robust Spoken Language Understanding by Cross Attention between Phoneme Sequence and ASR Hypothesis},
author = {Zexun Wang and Yuquan Le and Yi Zhu and Yuming Zhao and Mingchao Feng and Meng Chen and Xiaodong He},
journal= {arXiv preprint arXiv:2203.12067},
year = {2022}
}
备注
ICASSP 2022