中文

DiTaiListener:基于扩散模型的可控高保真听者视频生成

计算机视觉与模式识别 2025-04-08 v1 机器学习

摘要

生成自然且细腻的听者动作以进行长时间交互仍是未解决的难题。现有方法常依赖低维运动代码进行面部行为生成,再进行照明逼真渲染,限制了视觉保真度和表达丰富性。为此,我们引入 DiTaiListener,由视频扩散模型驱动,融合多模态条件。我们的方法首先生成听者反应的短片段,基于说话者的语音和面部动作进行条件化 (DiTaiListener-Gen),随后通过 DiTaiListener-Edit 精炼过渡帧,实现无缝衔接。具体而言,DiTaiListener-Gen 引入因果时序多模态适配器 (CTM-Adapter) 来处理说话者的听觉和视觉线索,适配 Diffusion Transformer (DiT) 用于听者头部肖像生成。CTM-Adapter 以因果方式将说话者输入融入视频生成过程,以确保听者反应的时间一致性。对于长视频生成,我们引入 DiTaiListener-Edit,一种视频到视频的转换精炼扩散模型。该模型将短片段融合为光滑连续的视频,确保面部表情和图像质量在合并由 DiTaiListener-Gen 生成的短视频片段时保持时间一致性。定量上,DiTaiListener 在基准数据集上在照明逼真 (+73.8% FID 提升于 RealTalk) 和运动表示 (+6.1% FD 指标提升于 VICO) 两个维度实现了最新性能。用户研究确认了 DiTaiListener 的优越性能,模型在反馈、多样性和平滑度方面均显著优于竞争方法。

关键词

引用

@article{arxiv.2504.04010,
  title  = {DiTaiListener: Controllable High Fidelity Listener Video Generation with Diffusion},
  author = {Maksim Siniukov and Di Chang and Minh Tran and Hongkun Gong and Ashutosh Chaubey and Mohammad Soleymani},
  journal= {arXiv preprint arXiv:2504.04010},
  year   = {2025}
}

备注

Project page: https://havent-invented.github.io/DiTaiListener