Bind-Your-Avatar:基于动态 3D 掩码嵌入路由的多说话人物视频生成
计算机视觉与模式识别
2025-06-25 v1
摘要
近年来,音频驱动的说话头部生成技术取得了显著进展。然而,现有方法主要聚焦于单角色场景。虽然部分方法可创建两个人的对话视频,但生成多角色在同一空间环境中共同存在的统一对话视频的挑战仍未得到充分解决。这种设定提出了两个关键难题:音频到角色之间的对应关系控制以及缺乏包含多角色说话视频的数据集。为此,我们提出 Bind-Your-Avatar,一个针对同一场景下多角色说话视频生成设计的 MM-DiT 模型。具体而言,我们提出 (1) 一种新型框架,融入细粒度嵌入路由器,将"谁"与"说什么"绑定,以解决音频到角色对应的控制问题。(2) 两种实现 3D 掩码嵌入路由器的方法,使模型能够对每个角色进行帧级、细粒度控制,基于观察到的几何先验设计不同的损失函数,并通过掩码细化策略提升预测掩码的准确性与时序平滑性。(3) 目前为人类所知,首个专为多角色说话视频生成而构建的数据集,并附带开源数据处理管道。(4) 针对双角色说话视频生成的基准测试,通过大量实验表明我们的方法在多个最新方法上表现显著优越。
引用
@article{arxiv.2506.19833,
title = {Bind-Your-Avatar: Multi-Talking-Character Video Generation with Dynamic 3D-mask-based Embedding Router},
author = {Yubo Huang and Weiqiang Wang and Sirui Zhao and Tong Xu and Lin Liu and Enhong Chen},
journal= {arXiv preprint arXiv:2506.19833},
year = {2025}
}