利用文本数据服务于语音转文本任务的通用多任务学习框架
计算与语言
2021-02-12 v2
摘要
基于注意力的序列到序列建模为需要将一个序列映射到不同序列的应用提供了强大而优雅的解决方案。其成功严重依赖于大量训练数据的可用性。这对标注语音数据获取非常昂贵的语音应用(如自动语音识别(ASR)和语音翻译(ST))提出了挑战。在本研究中,我们提出一种通用多任务学习框架,以利用文本数据服务于 ASR 和 ST 任务。我们提出将两个辅助任务——去噪自编码器任务和机器翻译任务——分别与 ASR 和 ST 任务联合训练。我们证明将文本输入表示为音素序列可减小语音与文本输入之间的差异,并增强从文本语料库到语音转文本任务的知识迁移。我们的实验表明,相较于基线,所提方法在英语 Librispeech 任务上实现了 10~15% 的相对词错误率降低,并在 MuST-C 任务上将语音翻译质量提升了 3.6~9.2 BLEU。
引用
@article{arxiv.2010.11338,
title = {A General Multi-Task Learning Framework to Leverage Text Data for Speech to Text Tasks},
author = {Yun Tang and Juan Pino and Changhan Wang and Xutai Ma and Dmitriy Genzel},
journal= {arXiv preprint arXiv:2010.11338},
year = {2021}
}
备注
Accepted for ICASSP2021