基于语音-文本的多模态训练与双向注意力机制以改进语音识别
音频与语音处理
2022-11-02 v1 计算与语言
声音
摘要
为使最先进的端到端ASR模型兼具数据效率,并能通过多模态训练利用更多无配对文本数据,需解决两个问题:1)语音与语言(即文本数据)间特征采样率的同步性;2)两个编码器所学表示的同质性。本文提出采用一种新颖的双向注意力机制(BiAM),以多模态学习方法联合训练ASR编码器(底层)与文本编码器。BiAM促进特征采样率交换,使一类变换后特征的质量可在另一空间中度量,并配以多样化目标函数。结果表明,语音表示融入了更丰富的语言信息,而文本编码器生成的表示更接近于相应语音表示,因而共享的ASR模型更适于无配对文本数据预训练。为验证所提方法有效性,我们在有/无额外无配对文本数据下进行了两类实验。在Librispeech语料库上的实验结果显示,仅用配对数据学习即可实现最高6.15%的词错率降低(WERR),而使用更多无配对文本数据时WERR达9.23%。
引用
@article{arxiv.2211.00325,
title = {Speech-text based multi-modal training with bidirectional attention for improved speech recognition},
author = {Yuhang Yang and Haihua Xu and Hao Huang and Eng Siong Chng and Sheng Li},
journal= {arXiv preprint arXiv:2211.00325},
year = {2022}
}
备注
5 pages, 3 figures, 3 tables