基于声学与语义协同解码的多模态视角重新审视语音识别
计算与语言
2023-05-24 v1 声音
音频与语音处理
摘要
基于注意力的编码器-解码器(AED)模型在ASR中已展现出令人印象深刻的性能。然而,大多数现有AED方法忽视了解码器中同时利用声学和语义特征,而这对生成更准确且信息更丰富的语义状态至关重要。在本文中,我们提出一种用于ASR的声学与语义协同解码器(ASCD)。具体而言,与在两个独立阶段处理声学和语义特征的普通解码器不同,ASCD对二者进行协同集成。为防止训练期间的信息泄漏,我们设计了因果多模态掩码。此外,提出了一种变体Semi-ASCD以平衡准确率与计算成本。我们的方案在公开可用的AISHELL-1和aidatatang_200zh数据集上使用Transformer、Conformer和Branchformer分别作为编码器进行评估。实验结果表明,ASCD通过协同利用声学和语义信息显著提升了性能。
引用
@article{arxiv.2305.14049,
title = {Rethinking Speech Recognition with A Multimodal Perspective via Acoustic and Semantic Cooperative Decoding},
author = {Tian-Hao Zhang and Hai-Bo Qin and Zhi-Hao Lai and Song-Lu Chen and Qi Liu and Feng Chen and Xinyuan Qian and Xu-Cheng Yin},
journal= {arXiv preprint arXiv:2305.14049},
year = {2023}
}
备注
Accepted by Interspeech 2023