中文

NWPU-ASLP 系统在 VoicePrivacy 2022 挑战赛中的方案

音频与语音处理 2022-09-27 v1 声音

摘要

本文介绍了 NWPU-ASLP 用于 VoicePrivacy 2022 挑战赛的说话人匿名化系统。我们的提交方案不涉及额外的自动说话人验证(ASV)模型或 x-vector 池。我们的系统由四个模块组成,包括特征提取器、声学模型、匿名化模块和神经声码器。首先,特征提取器从输入语音信号中提取音素后验图(PPG)和基频(pitch)。然后,我们从一个说话人查找表(LUT)中保留一个伪说话人 ID,随后将其输入说话人编码器以生成不对应于任何真实说话人的伪说话人嵌入。为确保伪说话人可区分,我们进一步对随机选择的说话人嵌入取平均,并将其与伪说话人嵌入加权拼接,以生成匿名化说话人嵌入。最后,声学模型从匿名化说话人嵌入输出匿名化 mel 谱图,改进版 HifiGAN 将 mel 谱图转换为匿名化语音波形。实验结果证明了我们所提匿名化系统的有效性。

关键词

引用

@article{arxiv.2209.11969,
  title  = {NWPU-ASLP System for the VoicePrivacy 2022 Challenge},
  author = {Jixun Yao and Qing Wang and Li Zhang and Pengcheng Guo and Yuhao Liang and Lei Xie},
  journal= {arXiv preprint arXiv:2209.11969},
  year   = {2022}
}

备注

VoicePrivacy 2022 Challenge