DubWise: 基于多模态 LLM 的文本转语音中视频引导的语音时长控制
音频与语音处理
2024-06-14 v1 声音
摘要
音频视觉对齐在配音后是一个具有挑战性的研究问题。为此,我们提出了一种新方法——DubWise 多模态大型语言模型(LLM)基于文本转语音(Text-to-Speech, TTS)的方法,能够控制合成语音的时长,使其与给定参考视频中说话者的唇部动作良好匹配,即使 spoken text 不同或语言不同亦可。为实现这一目标,我们提出在预训练的基于 GPT 的 TTS 模型中运用跨模态注意力技术。我们将文本中的语言标记、通过声纲克隆网络获得的说话者身份标记以及通过我们提出的时长控制网络获得的视频标记相结合。我们在 Lip2Wav-Chemistry 和 LRS2 数据集上展示了该系统的有效性。此外,所提出的方法在相同语言但文本不同(即非平行场景)以及不同语言、不同文本(即跨语言场景)下,相较于 SOTA 方法在唇部同步和自然度方面均取得了改进。
引用
@article{arxiv.2406.08802,
title = {DubWise: Video-Guided Speech Duration Control in Multimodal LLM-based Text-to-Speech for Dubbing},
author = {Neha Sahipjohn and Ashishkumar Gudmalwar and Nirmesh Shah and Pankaj Wasnik and Rajiv Ratn Shah},
journal= {arXiv preprint arXiv:2406.08802},
year = {2024}
}
备注
Accepted at INTERSPEECH 2024