MultiTalk: 跨语言提升 3D 说话人头生成的多语言视频数据集
计算机视觉与模式识别
2024-06-21 v1 图形学
摘要
最近的研究在语音驱动的 3D 说话人头生成方面取得了令人满意的口语表达效果。然而, 当输入语 speech 应用到其他语言时,生成准确的唇同步会出现性能下降,这可能是由于缺乏覆盖不同语言广泛面脸部动作的数据集所致。本文引入了从多语言语 speech 生成 3D 说话人头的新任务。我们收集了一个包含 20 种语言、超过 420 小时说话视频的新型多语言 2D 视频数据集。基于我们提出的数据集,我们 presented 一个多语言增强模型, incorporates 语言特定风格嵌入, 使其能够捕捉每种语言特有的口部动作。此外,我们提出了一个用于评估多语言环境下唇同步准确性的指标。我们表明,使用我们提出的数据集训练 3D 说话人头模型可显著提升其多语言性能。代码和数据集已提供于 https://multi-talk.github.io/。
引用
@article{arxiv.2406.14272,
title = {MultiTalk: Enhancing 3D Talking Head Generation Across Languages with Multilingual Video Dataset},
author = {Kim Sung-Bin and Lee Chae-Yeon and Gihun Son and Oh Hyun-Bin and Janghoon Ju and Suekyeong Nam and Tae-Hyun Oh},
journal= {arXiv preprint arXiv:2406.14272},
year = {2024}
}
备注
Interspeech 2024