中文

Accent-VITS:面向端到端 TTS 的口音迁移

声音 2024-01-01 v2 音频与语音处理

摘要

口音迁移旨在将源说话人的口音迁移至目标说话人声音的合成语音中。主要挑战在于如何有效解耦语音中相互交织的说话人音色与口音。本文提出了一种基于 VITS 的端到端口音迁移模型,名为 Accent-VITS。基于 VITS 的主体结构,Accent-VITS 进行了实质性改进,以实现有效且稳定的口音迁移。我们利用分层 CVAE 结构分别对口音发音信息和声学特征进行建模,并以瓶颈特征和梅尔频谱作为约束。此外,VITS 中的文本到波形映射在 Accent-VITS 中被分解为文本到口音和口音到波形的映射。通过这种方式,口音与说话人音色的解耦变得更加稳定和有效。在多口音和普通话数据集上的实验表明,与强基线相比,Accent-VITS 实现了更高的说话人相似度、口音相似度和语音自然度。

关键词

引用

@article{arxiv.2312.16850,
  title  = {Accent-VITS:accent transfer for end-to-end TTS},
  author = {Linhan Ma and Yongmao Zhang and Xinfa Zhu and Yi Lei and Ziqian Ning and Pengcheng Zhu and Lei Xie},
  journal= {arXiv preprint arXiv:2312.16850},
  year   = {2024}
}

备注

Accepted by NCMMSC2023