用于语音转文本任务的混合 Transducer 与基于注意力的编码器-解码器建模
计算与语言
2023-05-08 v1 声音
音频与语音处理
摘要
Transducer 与基于注意力的编码器-解码器(AED)是两种广泛使用的语音转文本任务框架。它们为不同目的而设计,各自在语音转文本任务上有其优势与不足。为利用两种建模方法的优势,我们提出一种通过结合 Transducer 与基于注意力的编码器-解码器(TAED)解决语音转文本任务的方案。新方法利用 AED 在非单调序列到序列学习上的优势,同时保留 Transducer 的流式特性。在所提框架中,Transducer 与 AED 共享同一语音编码器。Transducer 中的预测器被 AED 模型中的解码器替代,且解码器的输出以语音输入为条件,而非来自无条件语言模型的输出。所提方案确保模型通过覆盖所有可能读/写场景得到优化,并为流式应用创建匹配环境。我们在 \textsc{MuST-C} 数据集上评估所提方法,结果表明 TAED 在离线自动语音识别(ASR)与语音到文本翻译(ST)任务上显著优于 Transducer。在流式情形下,TAED 在 ASR 任务与一个 ST 方向上优于 Transducer,而在另一翻译方向上取得相当结果。
引用
@article{arxiv.2305.03101,
title = {Hybrid Transducer and Attention based Encoder-Decoder Modeling for Speech-to-Text Tasks},
author = {Yun Tang and Anna Y. Sun and Hirofumi Inaguma and Xinyue Chen and Ning Dong and Xutai Ma and Paden D. Tomasello and Juan Pino},
journal= {arXiv preprint arXiv:2305.03101},
year = {2023}
}
备注
ACL 2023 main conference