VCVTS:基于从语音转换进行跨模态知识迁移的多说话人视频到语音合成
音频与语音处理
2022-02-21 v1 人工智能
计算机视觉与模式识别
多媒体
声音
图像与视频处理
摘要
尽管针对特定说话人的视频到语音(Video-to-Speech, VTS)合成已取得显著进展,但鲜有研究关注可在单一系统中将无声视频映射为语音并同时允许灵活控制说话人身份的多说话人 VTS。本文提出了一种新颖的多说话人 VTS 系统,基于从语音转换(Voice Conversion, VC)进行的跨模态知识迁移,其中使用结合对比预测编码的向量量化(VQCPC)作为 VC 的内容编码器以导出离散的类音素声学单元,并将其迁移至 Lip-to-Index(Lip2Ind)网络以推断声学单元的索引序列。随后,Lip2Ind 网络可替代 VC 的内容编码器,构成多说话人 VTS 系统,将无声视频转换为声学单元以重建准确的语音内容。该 VTS 系统还继承了 VC 的优势,利用说话人编码器生成说话人表示,从而有效控制生成语音的说话人身份。大量评估验证了所提方法的有效性,该方法可应用于受限词表和开放词表条件,在生成具有高自然度、可懂度和说话人相似度的高质量语音方面达到了 SOTA 性能。我们的演示页面发布于:https://wendison.github.io/VCVTS-demo/
引用
@article{arxiv.2202.09081,
title = {VCVTS: Multi-speaker Video-to-Speech synthesis via cross-modal knowledge transfer from voice conversion},
author = {Disong Wang and Shan Yang and Dan Su and Xunying Liu and Dong Yu and Helen Meng},
journal= {arXiv preprint arXiv:2202.09081},
year = {2022}
}
备注
Accepted to ICASSP 2022. Demo page is available at https://wendison.github.io/VCVTS-demo/