中文

基于文本模态融合与音素级自监督特征的语音转换增强方法 FabasedVC

声音 2025-11-14 v1

摘要

在语音转换(VC)中,关键在于在准确建模目标说话者的音 timbre 与韵律的同时,完整保留语义信息。本文提出了 FabasedVC 以实现与目标说话者在音 timbre、韵律和持续时间上的一致性更高,同时改进内容完整性的语音转换方法。这是一个基于 VITS 的端到端语音转换系统,集成了相关文本模态信息、音素级自监督学习(SSL)特征和持续时间预测器。具体而言,我们采用文本特征编码器对文本、音素、声调和 BERT 特征等属性进行编码。随后,我们使用两种方法——平均池化和基于每个音素持续时间的注意力机制,将帧级 SSL 特征处理为音素级特征。此外,还Incorporate了一个持续时间预测器,以更好地对齐目标说话者的语速和韵律。实验结果表明,我们的方法在自然度、相似度和内容完整性方面均优于竞争系统。

关键词

引用

@article{arxiv.2511.10112,
  title  = {FabasedVC: Enhancing Voice Conversion with Text Modality Fusion and Phoneme-Level SSL Features},
  author = {Wenyu Wang and Zhetao Hu and Yiquan Zhou and Jiacheng Xu and Zhiyu Wu and Chen Li and Shihao Li},
  journal= {arXiv preprint arXiv:2511.10112},
  year   = {2025}
}

备注

Accepted by ACMMM-Asia 2025