MAESTRO:通过模态匹配实现匹配的语音文本表征
计算与语言
2022-07-05 v2 声音
音频与语音处理
摘要
我们提出了Maestro,这是一种自监督训练方法,用于统一从语音和文本模态中学习到的表征。从语音信号中进行自监督学习旨在学习信号中固有的潜在结构,而从文本中进行自监督学习则试图捕获词汇信息。从不成对的语音和文本序列中学习对齐的表征是一项具有挑战性的任务。先前的工作要么通过多任务和参数共享隐式地强制从这两种模态学习到的表征在潜在空间中对齐,要么通过语音合成进行模态转换来显式对齐。前者受到两种模态之间干扰的影响,而后者则引入了额外的复杂性。在本文中,我们提出了Maestro,这是一种新颖的算法,可以同时从这两种模态中学习统一的表征,并能迁移到多种下游任务,如自动语音识别(ASR)和语音翻译(ST)。Maestro通过序列对齐、时长预测以及通过一个对齐的掩码语言模型损失在所学空间中匹配嵌入来学习统一表征。我们在VoxPopuli多语言ASR上建立了新的最先进水平(SOTA),词错误率(WER)相对降低8%,在多领域SpeechStew ASR上相对降低3.7%,并在CoVoST 2的21种语言到英语的多语言ST上,平均BLEU值提高了2.8。
引用
@article{arxiv.2204.03409,
title = {MAESTRO: Matched Speech Text Representations through Modality Matching},
author = {Zhehuai Chen and Yu Zhang and Andrew Rosenberg and Bhuvana Ramabhadran and Pedro Moreno and Ankur Bapna and Heiga Zen},
journal= {arXiv preprint arXiv:2204.03409},
year = {2022}
}
备注
Accepted by Interspeech 2022