通过多任务学习在噪声鲁棒语音转换中保留背景声
音频与语音处理
2022-11-08 v1 声音
摘要
背景声是一种信息性的艺术形式,有助于在实际应用的语音转换(VC)场景中提供更沉浸的体验。然而,以往关于 VC 的研究主要关注干净语音,很少关注带背景声的 VC。在 VC 中保留背景声的关键问题在于神经分离模型不可避免的语音失真,以及源分离模型与 VC 模型之间的级联失配。本文提出一种通过多任务学习的端到端框架,其顺序级联源分离(SS)模块、瓶颈特征提取模块与 VC 模块。具体而言,源分离任务显式考虑关键相位信息并限制由不完美分离过程引起的失真。源分离任务、典型 VC 任务与统一任务共享由联合训练约束的统一重建损失,以减小 SS 与 VC 模块间的失配。实验结果表明,我们提出的框架显著优于基线系统,同时取得与用干净数据训练的 VC 模型相当的语音质量与说话人相似度。
引用
@article{arxiv.2211.03036,
title = {Preserving background sound in noise-robust voice conversion via multi-task learning},
author = {Jixun Yao and Yi Lei and Qing Wang and Pengcheng Guo and Ziqian Ning and Lei Xie and Hai Li and Junhui Liu and Danming Xie},
journal= {arXiv preprint arXiv:2211.03036},
year = {2022}
}
备注
Submitted to ICASSP 2023