中文

基于掩码选择性状态空间建模的音视频受控视频扩散用于自然说话人脸生成

计算机视觉与模式识别 2025-04-08 v3

摘要

说话人脸合成对于虚拟头像和人机交互至关重要,但大多数现有方法通常仅限于接受单一主要模态的控制,限制了其实际实用性。为此,我们引入了\textbf{ACTalker},一个支持多信号控制和单信号控制的端到端视频扩散框架,用于说话人脸视频生成。对于多控制,我们设计了具有多个分支的平行mamba结构,每个分支利用独立的驱动信号控制特定的面部区域。在所有分支上应用门控机制,提供对视频生成的灵活控制。为确保受控视频在时空上的自然协调,我们采用mamba结构,使驱动信号能够在每个分支的两个维度上操控特征标记。此外,我们引入一种mask-drop策略,使每个驱动信号能够在mamba结构中独立控制其对应的面部区域,防止控制冲突。实验结果表明,我们的方法产生的面部视频在由多样化信号驱动时外观自然,且mamba层无缝地将多个驱动模态集成到视频生成中而不会产生冲突。项目网站可在https://harlanhong.github.io/publications/actalker/index.html找到。

关键词

引用

@article{arxiv.2504.02542,
  title  = {Audio-visual Controlled Video Diffusion with Masked Selective State Spaces Modeling for Natural Talking Head Generation},
  author = {Fa-Ting Hong and Zunnan Xu and Zixiang Zhou and Jun Zhou and Xiu Li and Qin Lin and Qinglin Lu and Dan Xu},
  journal= {arXiv preprint arXiv:2504.02542},
  year   = {2025}
}