中文

EXPRESSO:无文本表达性语音重合成基准与分析

计算与语言 2023-08-11 v1 机器学习 声音 音频与语音处理

摘要

近期研究表明,可以基于以自监督方式学到的低比特率离散单元(而非文本)来重合成高质量语音,这些单元因而能够捕捉难以转写的语音表达性方面(韵律、声音风格、非语言发声)。这些方法的采用仍受限于大多数语音合成数据集为朗读式,严重限制了自发性与表达性。在此,我们引入 Expresso,一个用于无文本语音合成的高质量表达性语音数据集,包含朗读语音与以 26 种自发表达风格演绎的即兴对话。我们通过一个表达性重合成基准来说明该数据集的挑战与潜力,其任务是将输入编码为低比特率单元,并在保留内容与风格的前提下以目标声音重合成。我们用针对不同自监督离散编码器的自动指标评估重合成质量,并探讨质量、比特率以及对说话人与风格不变性之间的权衡。所有数据集、评估指标与基线模型均为开源。

关键词

引用

@article{arxiv.2308.05725,
  title  = {EXPRESSO: A Benchmark and Analysis of Discrete Expressive Speech Resynthesis},
  author = {Tu Anh Nguyen and Wei-Ning Hsu and Antony D'Avirro and Bowen Shi and Itai Gat and Maryam Fazel-Zarani and Tal Remez and Jade Copet and Gabriel Synnaeve and Michael Hassid and Felix Kreuk and Yossi Adi and Emmanuel Dupoux},
  journal= {arXiv preprint arXiv:2308.05725},
  year   = {2023}
}