中文

从对比式音素-声学预训练中学习语音表示

音频与语音处理 2023-12-19 v5 人工智能 计算与语言 声音

摘要

对于极小监督文本到语音(TTS)、语音转换(VC)和自动语音识别(ASR)等细粒度生成与识别任务,从语音中提取的中间表示应作为文本与声学信息之间的“桥梁”,包含来自两种模态的信息。语义内容被强调,而说话人身份和声学细节等副语言信息应被弱化。然而,现有的从语音中提取细粒度中间表示的方法存在冗余过多和维度爆炸的问题。对比学习是一种对来自两种模态的中间表示进行建模的良好方法。然而,音频领域现有的对比学习方法侧重于为下游音频分类任务提取全局描述性信息,使其不适用于 TTS、VC 和 ASR 任务。为解决这些问题,我们提出了一种名为“对比式音素-声学预训练(CTAP)”的方法,该方法使用两个编码器将音素和语音带入联合多模态空间,学习如何在帧级别上连接音素与语音。CTAP 模型在 21 万对语音与音素对上训练,实现了极小监督的 TTS、VC 和 ASR。所提出的 CTAP 方法为语音处理中的细粒度生成与识别下游任务提供了一种有前景的解决方案。我们提供了一个含有音频样本的网站。

关键词

引用

@article{arxiv.2309.00424,
  title  = {Learning Speech Representation From Contrastive Token-Acoustic Pretraining},
  author = {Chunyu Qiang and Hao Li and Yixin Tian and Ruibo Fu and Tao Wang and Longbiao Wang and Jianwu Dang},
  journal= {arXiv preprint arXiv:2309.00424},
  year   = {2023}
}

备注

Accepted by ICASSP 2024