中文

MoCoTalk:基于自适应路由器的多条件扩散对话头部生成

计算机视觉与模式识别 2026-05-11 v1

摘要

说话头部生成需要联合建模身份、头部姿态、面部表情和口部动态。现有方法通常仅解决部分因素,依赖固定权重或启发式融合策略处理多个条件。我们提出了MoCoTalk,一个多条件视频扩散框架,统一四种互补控制信号:参考图像、面部关键点、3DMM渲染的阴影网格和相应的语音音频。为解决异构条件之间的破坏性干扰,我们引入了自适应多条件路由器,计算四个条件流在通道级、时间步级的门控,以便根据特征子空间和噪声水平调整融合策略。为更好地捕捉与语音相关的面部动态,我们设计了口部增强阴影网格,一种3DMM表示方法,将头部运动、口部运动、表情和光照解耦。该设计提供了时序一致的几何先验,允许在推断阶段灵活组合这些属性。我们进一步引入了唇部一致性损失以紧密对齐音视信号。广泛的实验表明,MoCoTalk在大多数结构、运动和感知指标上实现了最先进的性能,同时提供了单一条件方法所不具备的属性级可控性。

关键词

引用

@article{arxiv.2605.08050,
  title  = {MoCoTalk: Multi-Conditional Diffusion with Adaptive Router for Controllable Talking Head Generation},
  author = {Xinyan Ye and Jiankang Deng and Abbas Edalat},
  journal= {arXiv preprint arXiv:2605.08050},
  year   = {2026}
}