Wav2Seq:使用伪语言预训练语音到文本编码器-解码器模型
计算与语言
2022-05-03 v1 机器学习
声音
音频与语音处理
摘要
我们提出Wav2Seq,这是首个用于预训练语音数据编码器-解码器模型两部分的自监督方法。我们引入伪语言作为紧凑的离散表示,并构建自监督伪语音识别任务——将音频输入转写为伪子词序列。该过程可独立使用,或作为低成本的第二阶段预训练应用。我们在自动语音识别(ASR)、口语命名实体识别和语音到文本翻译上进行了实验。我们为端到端口语命名实体识别确立了新的最先进结果,并在20个语言对的语音到文本翻译上展示了持续改进,即使竞争方法使用额外文本数据训练。最后,在ASR上,我们的方法使编码器-解码器方法能够受益于网络所有部分的预训练,并展示出与高度优化的近期方法相当的性能。
引用
@article{arxiv.2205.01086,
title = {Wav2Seq: Pre-training Speech-to-Text Encoder-Decoder Models Using Pseudo Languages},
author = {Felix Wu and Kwangyoun Kim and Shinji Watanabe and Kyu Han and Ryan McDonald and Kilian Q. Weinberger and Yoav Artzi},
journal= {arXiv preprint arXiv:2205.01086},
year = {2022}
}
备注
Code available at https://github.com/asappresearch/wav2seq