基于记忆型人脸-语音对齐的面部驱动零样本语音转换
声音
2023-09-19 v1 机器学习
多媒体
音频与语音处理
摘要
本文提出一项新任务:基于人脸图像的零样本语音转换(zero-shot FaceVC),其目标是将任意源说话人某条语音的语音特征转换为新到来的目标说话人,仅依赖目标说话人的单张人脸图像。为应对该任务,我们提出了一种基于人脸-语音记忆的零样本 FaceVC 方法。该方法利用一个基于记忆的人脸-语音对齐模块,其中槽位(slots)充当桥接以对齐这两种模态,从而能够从人脸图像中捕获语音特征。我们还引入了混合监督策略,以缓解语音转换任务中长期存在的训练与推理阶段不一致的问题。为获取说话人无关的内容相关表示,我们将一个预训练的零样本语音转换模型的知识迁移至我们的零样本 FaceVC 模型。考虑到 FaceVC 与传统语音转换任务之间的差异,我们设计了系统的主观与客观指标,以全面评估由人脸图像控制的语音特征的一致性、多样性与保真度。通过大量实验,我们证明了所提方法在零样本 FaceVC 任务上的优越性。样本已发布于我们的演示网站。
引用
@article{arxiv.2309.09470,
title = {Face-Driven Zero-Shot Voice Conversion with Memory-based Face-Voice Alignment},
author = {Zheng-Yan Sheng and Yang Ai and Yan-Nian Chen and Zhen-Hua Ling},
journal= {arXiv preprint arXiv:2309.09470},
year = {2023}
}