中文

基于离散单元的掩码技术用于提高语音转换中的离因子化

音频与语音处理 2024-09-19 v1 机器学习 声音

摘要

语音转换(VC)旨在修改说话者的身份,同时保留语言内容。常用的方法是采用编码器-解码器结构,语音身份与语言信息的离因子化至关重要。然而,这些方法所使用的离因子化方法受限于语音特征依赖于语音的音素内容,导致离因子化受限。这种依赖在基于注意力的方法中被放大。为解决此问题,本文引入一种新的掩码机制,置于输入层之前,对与音素类别高度相关的离散语音单元进行掩码。我们的工作旨在通过限制对部分音素信息的访问来降低语音特征的音素依赖性。此外,由于该方法位于输入层,因此可适用于任何基于编码器-解码器的 VC 框架。我们的 methods 在多种 VC 方法中均显著提升了离因子化和转换性能,尤其在基于注意力的方法中,客观可读性提升了 44%。

关键词

引用

@article{arxiv.2409.11560,
  title  = {Discrete Unit based Masking for Improving Disentanglement in Voice Conversion},
  author = {Philip H. Lee and Ismail Rasim Ulgen and Berrak Sisman},
  journal= {arXiv preprint arXiv:2409.11560},
  year   = {2024}
}

备注

Accepted to IEEE SLT 2024