改进直接音视频双语语音翻译中的唇部同步性
声音
2024-12-24 v1 计算与语言
计算机视觉与模式识别
多媒体
音频与语音处理
摘要
音视频双语语音翻译(AVS2S)通常侧重于提高翻译质量和自然度。然而,音视频内容中的唇部同步性——确保唇部动作与语音内容相匹配——同样至关重要,这对于维持配音视频的真实感至关重要。尽管其重要性已被广泛认识,但在 AVS2S 模型中加入唇部同步约束的工作仍较少见。本研究通过将唇部同步损失整合到 AVS2S 模型的训练过程中来弥补这一空白。我们提出的方法显著提高了直接音视频双语语音翻译中的唇部同步性,在四种语言对上实现了平均 LSE-D 分数为 10.67,较强基线降低了 9.2%。此外,该方法在将翻译语音叠加到原始视频上时,保持了自然度和高质量的翻译语音,未对翻译质量造成任何降级。
引用
@article{arxiv.2412.16530,
title = {Improving Lip-synchrony in Direct Audio-Visual Speech-to-Speech Translation},
author = {Lucas Goncalves and Prashant Mathur and Xing Niu and Brady Houston and Chandrashekhar Lavania and Srikanth Vishnubhotla and Lijia Sun and Anthony Ferritto},
journal= {arXiv preprint arXiv:2412.16530},
year = {2024}
}
备注
Accepted at ICASSP, 4 pages