中文

面向高采样率环境的 RAVE 语音:高效语音转换

声音 2024-08-30 v1 音频与语音处理

摘要

语音转换在音频操作和语音合成领域日益受到关注。通常,主要目标是将输入身份转换以匹配目标说话人身份,而不改变其语言内容。虽然当前工作提供了高保真度解决方案,但很少关注模型简单性、高采样率环境或流式处理。在将语音表示学习融入用于音乐目的的生成性时音风格迁移模型后,我们探索了在高采样率下直接生成语音转换的领域。更具体地,我们引导基线模型的潜在空间向语言相关表示导向,并以外部说话人信息为条件。通过客观和主观评估,我们展示了所提出的解决方案在已知说话人方面能够实现与最新方法相当的自然性、质量和可理解性水平,同时显著降低了推理时间。然而,尽管转换输出中包含目标说话人的特征,但与未见说话人的相似性仍然是一个挑战。

关键词

引用

@article{arxiv.2408.16546,
  title  = {RAVE for Speech: Efficient Voice Conversion at High Sampling Rates},
  author = {Anders R. Bargum and Simon Lajboschitz and Cumhur Erkut},
  journal= {arXiv preprint arXiv:2408.16546},
  year   = {2024}
}

备注

Accepted for publication in Proceedings of the 27th International Conference on Digital Audio Effects (DAFx24), Guildford, United Kingdom, 3 - 7 September 2024