中文

UTDUSS:面向 Interspeech2024 离散语音单元挑战赛的 UTokyo-SaruLab 语音处理系统

声音 2024-03-21 v1 音频与语音处理

摘要

我们提出了提交至 Interspeech2024 离散语音单元挑战赛的 UTokyo-SaruLab 系统 UTDUSS。该挑战赛聚焦于将从大型语音语料库中学习到的离散语音单元应用于某些任务。我们将 UTDUSS 系统提交至两个文本到语音赛道:Vocoder 和 Acoustic+Vocoder。我们的系统结合了仅在语音语料库上预训练的神经音频编解码器(NAC),这使得学习到的编解码器能够表示高保真语音重建所需的丰富声学特征。对于 Acoustic+Vocoder 赛道,我们训练了一个基于 Transformer 编码器-解码器的声学模型,该模型根据文本输入预测预训练的 NAC token。我们描述了构建这些模型的策略,例如数据选择、下采样和超参数调优。我们的系统在 Vocoder 和 Acoustic+Vocoder 赛道分别获得了第二名和第一名。

关键词

引用

@article{arxiv.2403.13720,
  title  = {UTDUSS: UTokyo-SaruLab System for Interspeech2024 Speech Processing Using Discrete Speech Unit Challenge},
  author = {Wataru Nakata and Kazuki Yamauchi and Dong Yang and Hiroaki Hyodo and Yuki Saito},
  journal= {arXiv preprint arXiv:2403.13720},
  year   = {2024}
}

备注

5 pages, 3 figures