MuteSwap:视觉导向的静默视频身份转换
声音
2025-08-05 v3 计算机视觉与模式识别
机器学习
多媒体
音频与语音处理
摘要
传统语音转换通过修改说话人特征从源说话人到目标说话人,依赖双方的音频输入。然而,在没有干净音频的情况下(如静默视频或噪声环境中),此过程便难以实现。在本工作中,我们关注静默面部语音转换(Silent Face-based Voice Conversion, SFVC)这一任务,即仅从视觉输入完成语音转换:给定目标说话人的图像和包含嘴型的源说话人静默视频,SFVC生成与目标说话人身份一致、同时保留源静默视频中语音内容的语音。由于该任务需要仅凭视觉线索生成可理解语音并进行身份转换,问题尤为挑战性。为此,我们引入MuteSwap,一种新型框架,采用对比学习对齐跨模态身份并最小化互信息以分离共享视觉特征。实验结果表明,MuteSwap在语音合成和身份转换方面均取得优异性能,尤其在噪声环境下,依赖音频输入的方法难以产生可理解结果,显示示了本训练方法的有效性以及SFVC的可行性。
引用
@article{arxiv.2507.00498,
title = {MuteSwap: Visual-informed Silent Video Identity Conversion},
author = {Yifan Liu and Yu Fang and Zhouhan Lin},
journal= {arXiv preprint arXiv:2507.00498},
year = {2025}
}