中文

重塑语音:基于深度学习的语音转换范围综述

声音 2023-11-15 v1 人工智能 音频与语音处理

摘要

在语音到语音场景中,关于基于深度学习的语音转换(VC)的研究正日益流行。尽管语音转换领域的许多工作共享一个通用的全局流程,但在所采用的基础结构、方法和神经子模块方面存在相当大的多样性。因此,全面理解语音转换流程中不同方法选择背后的原因可能具有挑战性,且所提出方案中的实际障碍往往不明确。为阐明这些方面,本文提出了一项范围综述,探讨现代语音转换系统中深度学习在语音分析、合成和解耦语音表示学习中的使用。我们筛选了 2017 年至 2023 年间来自 38 个不同以上场所的 621 篇出版物,随后对最终由 123 项合格研究组成的数据库进行了深入综述。基于该综述,我们总结了基于深度学习的最常用语音转换方法,并强调了社区内的常见陷阱。最后,我们凝练所获取的知识,识别主要挑战,并为未来研究方向提供建议。

关键词

引用

@article{arxiv.2311.08104,
  title  = {Reimagining Speech: A Scoping Review of Deep Learning-Powered Voice Conversion},
  author = {Anders R. Bargum and Stefania Serafin and Cumhur Erkut},
  journal= {arXiv preprint arXiv:2311.08104},
  year   = {2023}
}