中文

DualVC 2:面向统一流式与非流式语音转换的动态掩码卷积

音频与语音处理 2024-01-19 v2 声音

摘要

语音转换日益流行,越来越多的应用场景需要具有流式推理能力的模型。近期提出的 DualVC 试图通过流式模型架构设计、模型内知识蒸馏以及混合预测编码来弥补未来信息的缺失,从而实现该目标。然而,DualVC 存在若干限制其性能的问题。首先,自回归解码器天然存在误差累积,并限制了推理速度。其次,因果卷积虽实现了流式能力,但无法充分利用块内的未来信息。第三,模型无法有效处理清音段中的噪声,降低了音质。本文中,我们提出 DualVC 2 以解决这些问题。具体而言,模型主干迁移至基于 Conformer 的架构,支持并行推理。因果卷积被具有动态块掩码的非因果卷积取代,以更好地利用块内未来信息。同时,引入静音注意力以增强模型的噪声鲁棒性。实验表明,DualVC 2 在主观与客观指标上均优于 DualVC 及其他基线系统,且仅有 186.4 ms 延迟。我们的音频样本已公开可用。

关键词

引用

@article{arxiv.2309.15496,
  title  = {DualVC 2: Dynamic Masked Convolution for Unified Streaming and Non-Streaming Voice Conversion},
  author = {Ziqian Ning and Yuepeng Jiang and Pengcheng Zhu and Shuai Wang and Jixun Yao and Lei Xie and Mengxiao Bi},
  journal= {arXiv preprint arXiv:2309.15496},
  year   = {2024}
}

备注

Accepted by ICASSP2024