中文

Let Them Talk:音频驱动的多人对话视频生成

计算机视觉与模式识别 2025-05-29 v1

摘要

音频驱动的人体动画方法,如说话人脸和说话人体生成,在生成同步的面部运动和具有吸引力的视觉质量视频方面取得了显著进展。然而,现有方法主要关注单人生成,在处理多流音频输入时面临困难,且存在音频与人物之间绑定错误的问题。此外,它们在指令遵循能力方面也表现出局限性。为了解决这个问题,本文提出了一项新任务:多人对话视频生成,并引入了一个新框架 MultiTalk,以解决多人生成过程中的挑战。具体而言,在音频注入方面,我们研究了几种方案,并提出了标签旋转位置嵌入(L-RoPE)方法来解决音频与人物绑定问题。此外,在训练过程中,我们观察到部分参数训练和多任务训练对于保留基础模型的指令遵循能力至关重要。MultiTalk 在包括说话人脸、说话人体和多人数据集在内的多个数据集上取得了优于其他方法的性能,展示了我们方法强大的生成能力。

关键词

引用

@article{arxiv.2505.22647,
  title  = {Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation},
  author = {Zhe Kong and Feng Gao and Yong Zhang and Zhuoliang Kang and Xiaoming Wei and Xunliang Cai and Guanying Chen and Wenhan Luo},
  journal= {arXiv preprint arXiv:2505.22647},
  year   = {2025}
}

备注

Homepage: https://meigen-ai.github.io/multi-talk Github: https://github.com/MeiGen-AI/MultiTalk