中文

使用自监督学习模型对原始音频进行无文本语音合成的分析研究

计算与语言 2024-12-05 v1 声音 音频与语音处理

摘要

我们通过分析使用自监督学习(SSL)模型表示(而非传统文本表示)合成的语音,来检验从SSL模型获得的原始音频的无文本语音表示。由于原始音频不像转录文本那样具有配对的语音表示,因此从非配对语音中获取语音表示对于扩充语音合成的可用数据集至关重要。具体来说,所提出的语音合成是使用来自SSL模型的离散符号表示与文本表示对比进行的,并对合成的语音进行了分析性检验。结果经验性地表明,使用文本表示有利于保留语义信息,而使用离散符号表示则更擅长保留包括韵律和语调信息在内的声学内容。

关键词

引用

@article{arxiv.2412.03074,
  title  = {Analytic Study of Text-Free Speech Synthesis for Raw Audio using a Self-Supervised Learning Model},
  author = {Joonyong Park and Daisuke Saito and Nobuaki Minematsu},
  journal= {arXiv preprint arXiv:2412.03074},
  year   = {2024}
}

备注

APSIPA ASC 2024