SEF-VC:基于交叉注意力的免说话人嵌入零样本语音转换
声音
2024-01-31 v2 计算与语言
音频与语音处理
摘要
零样本语音转换(VC)旨在将源说话人音色转换为任意未见目标说话人的音色,同时保持语言内容不变。尽管可以通过提供目标说话人的说话人嵌入来控制生成语音的音色,但说话人相似度仍落后于真实录音。在本文中,我们提出了 SEF-VC,一种免说话人嵌入的语音转换模型,旨在通过强大的位置无关交叉注意力机制从参考语音中学习并融合说话人音色,然后以非自回归方式从 HuBERT 语义 token 重建波形。SEF-VC 简洁的设计增强了其训练稳定性和语音转换性能。客观和主观评估表明,SEF-VC 能够生成高质量语音,与强零样本 VC 基线相比,即使对于非常短的参考语音,也能实现与目标参考更好的相似度。
引用
@article{arxiv.2312.08676,
title = {SEF-VC: Speaker Embedding Free Zero-Shot Voice Conversion with Cross Attention},
author = {Junjie Li and Yiwei Guo and Xie Chen and Kai Yu},
journal= {arXiv preprint arXiv:2312.08676},
year = {2024}
}
备注
5 pages, 2 figures, accepted to ICASSP 2024