面向语音与口音联合识别的解耦交互多任务学习网络
声音
2023-11-20 v2 音频与语音处理
摘要
口音作为标准发音的变体,给语音识别系统带来显著挑战。尽管自动语音识别(ASR)与口音识别(AR)联合训练已被证明能有效处理多口音场景,现有的多任务 ASR-AR 方法忽视了任务间的粒度差异。细粒度单元捕捉与发音相关的口音特征,而粗粒度单元更利于学习语言信息。此外,两任务间的显式交互可提供互补信息并相互提升性能,但现有方法很少采用。本文提出一种新颖的解耦与交互多任务网络(DIMNet)用于语音与口音联合识别,其由连接主义时序分类(CTC)分支、AR 分支、ASR 分支以及底层特征编码器组成。具体地,AR 与 ASR 首先通过分离分支与双粒度建模单元解耦以学习任务特定表示。AR 分支基于我们此前提出的语言-声学双模态 AR 模型,ASR 分支为基于编码器-解码器的 Conformer 模型。随后,在任务交互方面,CTC 分支为 AR 任务提供对齐文本,而从 AR 模型提取的口音嵌入被注入 ASR 分支的编码器与解码器。最后,在 ASR 推理时,引入跨粒度重打分方法以融合解耦后 CTC 与注意力解码器的互补信息。我们在中英文数据集上的实验证明了所提模型的有效性,相较已发布的标准基线分别取得 21.45%/28.53% 的 AR 准确率相对提升与 32.33%/14.55% 的 ASR 错误率相对下降。
引用
@article{arxiv.2311.07062,
title = {Decoupling and Interacting Multi-Task Learning Network for Joint Speech and Accent Recognition},
author = {Qijie Shao and Pengcheng Guo and Jinghao Yan and Pengfei Hu and Lei Xie},
journal= {arXiv preprint arXiv:2311.07062},
year = {2023}
}
备注
Accepted by IEEE Transactions on Audio, Speech and Language Processing (TASLP)