AV2AV:基于统一音频-视觉语音表示的端到端音频-视觉语音到音频-视觉语音翻译
计算机视觉与模式识别
2024-03-27 v2 人工智能
多媒体
音频与语音处理
摘要
本文提出了一种新颖的直接音频-视觉语音到音频-视觉语音翻译(AV2AV)框架,其中系统的输入和输出是多模态的(即音频和视觉语音)。通过所提出的AV2AV,可以带来两个关键优势:1)我们可以利用自己的母语在虚拟会议中与世界各地的人进行真实对话。与仅在音频模态之间翻译的语音到语音翻译(A2A)相比,所提出的AV2AV直接在音频-视觉语音之间进行翻译。这种能力通过呈现与翻译语音同步的嘴唇运动来增强对话体验。2)我们可以提高口语翻译系统的鲁棒性。通过利用音频-视觉语音的互补信息,即使在存在声学噪声的情况下,系统也能有效翻译口语,展现出鲁棒性能。为了缓解缺乏并行AV2AV翻译数据集的问题,我们提出使用A2A的纯音频数据集来训练我们的口语翻译系统。这是通过预先通过自监督学习学习统一的音频-视觉语音表示来训练翻译系统实现的。此外,我们提出了一种AV-Renderer,可以并行生成原始音频和视频。它设计为零样本说话人建模,因此源音频-视觉语音中的说话人可以在目标翻译的音频-视觉语音中保持。通过在多对多语言翻译设置中的大量实验评估了AV2AV的有效性。演示页面可在https://choijeongsoo.github.io/av2av获取。
引用
@article{arxiv.2312.02512,
title = {AV2AV: Direct Audio-Visual Speech to Audio-Visual Speech Translation with Unified Audio-Visual Speech Representation},
author = {Jeongsoo Choi and Se Jin Park and Minsu Kim and Yong Man Ro},
journal= {arXiv preprint arXiv:2312.02512},
year = {2024}
}
备注
CVPR 2024. Code & Demo: https://choijeongsoo.github.io/av2av