中文

基于自监督学习与特征提取的语音与歌唱口音转换统一模型

声音 2024-12-12 v1 机器学习 多媒体 音频与语音处理

摘要

本文提出了一种新的语音转换模型,能够同时处理语音和歌唱语音的转换。该模型解决了当前系统中的关键挑战,如情感传达、发音和口音变化的管理以及非语音声音的再现。该模型的一大亮点是能够在同时包含语音和歌唱的混合语音样本上执行口音转换,在改变说话者口音的同时保留原始内容和韵律。所提出的模型采用编码器-解码器架构:编码器基于 HuBERT 来处理语音的声学与语言内容,而 HiFi-GAN 解码器则匹配目标说话者的声音。该模型引入了基频(f0)特征和歌手嵌入以提升性能,同时确保转换过程中音高与音色的准确性以及声音身份的保持。该方法改善了语音风格转换的自然性与灵活性,展现出在语音配音、内容创作以及文本转语音(TTS)和交互式语音响应(IVR)系统等技术领域中的巨大潜力。

关键词

引用

@article{arxiv.2412.08312,
  title  = {A Unified Model For Voice and Accent Conversion In Speech and Singing using Self-Supervised Learning and Feature Extraction},
  author = {Sowmya Cheripally},
  journal= {arXiv preprint arXiv:2412.08312},
  year   = {2024}
}

备注

7 pages, 5 figures, 2 tables