中文

面向非平行语音转换的 Transformer 模型 VCTR

声音 2025-10-16 v1

摘要

非平行语音转换旨在将来自一个源域的语音转换为目标域,无需配对训练数据。循环一致生成对抗网络(CycleGAN)和变分自编码器(VAE)已用于此任务,但这些模型 suffer于训练困难和结果不令人满意。后来引入了对比语音转换(CVC),利用对比学习方法来解决这些问题。然而,这些方法使用基于 CNN 的生成器,能够捕捉局部语义,但缺乏捕捉全局语义所必需的长程依赖关系。本文提出了 VCTR,一种高效的方法,用于非平行语音转换,利用混合感知块(HPB)和双精修剪自注意力(DPSA)以及对比学习的对抗方法。代码可在 https://github.com/Maharnab-Saikia/VCTR 查找。

关键词

引用

@article{arxiv.2510.12964,
  title  = {VCTR: A Transformer-Based Model for Non-parallel Voice Conversion},
  author = {Maharnab Saikia},
  journal= {arXiv preprint arXiv:2510.12964},
  year   = {2025}
}