中文

token2vec:一种利用非配对语音与文本的联合自监督预训练框架

计算与语言 2022-11-01 v1 声音 音频与语音处理

摘要

自监督预训练在文本与语音处理中均已取得成功。语音与文本提供不同但互补的信息。问题在于我们是否能够对非配对的语音与文本进行语音-文本联合预训练。本文将自监督预训练的思想推进一步,提出 token2vec,一种基于语音离散表示的、面向非配对语音与文本的联合预训练新框架。首先,由于语音与文本模态的显著差异(语音连续而文本离散),我们将语音离散化为离散语音 token 序列以解决模态不匹配问题。其次,为解决长度不匹配问题(语音序列通常远长于文本序列),我们将文本单词转换为音素序列,并随机重复序列中每个音素。最后,我们将离散语音与文本 token 输入与模态无关的 Transformer 编码器,并通过 token 级掩码语言建模(tMLM)进行预训练。实验表明,token2vec 显著优于多种仅语音预训练基线,相对词错率(WER)最高降低 17.7%。token2vec 模型也在非 ASR 任务即口语意图分类上得到验证,并展现出良好的可迁移性。

关键词

引用

@article{arxiv.2210.16755,
  title  = {token2vec: A Joint Self-Supervised Pre-training Framework Using Unpaired Speech and Text},
  author = {Xianghu Yue and Junyi Ao and Xiaoxue Gao and Haizhou Li},
  journal= {arXiv preprint arXiv:2210.16755},
  year   = {2022}
}

备注

Submitted to ICASSP 2023