MAVFlow: 基于条件流匹配的零样本 AV2AV 多语言翻译中的副语言元素保留
音频与语音处理
2025-07-31 v2 计算机视觉与模式识别
机器学习
多媒体
摘要
尽管文本到语音 (TTS) 模型近期取得了进展,但视听到视听 (AV2AV) 翻译仍面临一个关键挑战:在原始与翻译后的语音和面部特征之间保持说话人一致性。为解决这一问题,我们提出了一种条件流匹配 (CFM) 零样本视听渲染器,其利用来自音频和视觉模态的强双重引导。通过利用 CFM 的多模态引导,我们的模型稳健地保留了特定于说话人的特征,并增强了零样本 AV2AV 翻译能力。对于音频模态,我们通过将稳健的说话人嵌入与 x-vector 相结合来增强 CFM 过程,这有助于增强说话人一致性。此外,我们将情感细微差别传递至面部渲染模块。由音频和视觉线索提供的引导独立于语义或语言内容,使得我们的渲染器能够有效处理不同语言的单语说话人的零样本翻译任务。我们通过实验证明,以面部信息为条件的高质量 mel-spectrogram 的引入不仅增强了合成语音的质量,也对面部生成产生了积极影响,从而在 LSE 和 FID 分数上带来了整体性能的提升。我们的代码可在 https://github.com/Peter-SungwooCho/MAVFlow 获取。
引用
@article{arxiv.2503.11026,
title = {MAVFlow: Preserving Paralinguistic Elements with Conditional Flow Matching for Zero-Shot AV2AV Multilingual Translation},
author = {Sungwoo Cho and Jeongsoo Choi and Sungnyun Kim and Se-Young Yun},
journal= {arXiv preprint arXiv:2503.11026},
year = {2025}
}
备注
Accepted to ICCV 2025