中文

HumANDiff: 用于运动一致性人类视频生成的关节噪声扩散

计算机视觉与模式识别 2026-04-08 v1

摘要

尽管人类视频生成取得了巨大进展,生成式视频扩散模型仍然难以忠实捕捉人类运动的动态和物理特性。在本文中,我们提出了一种新的人类视频生成框架HumANDiff,通过三个关键设计增强人类运动控制:1)关节运动一致性噪声采样,将潜在噪声的时空分布相关联,并用采样在统计人体模板密集表面流形上的3D关节噪声替代无结构的高斯噪声。它继承了人体拓扑先验以实现空间和时间一致的噪声采样。2)联合外观-运动学习,通过联合预测来自关节噪声的像素外观和对应物理运动来增强视频扩散模型的标准训练目标。它实现了高保真度的人类视频合成,例如捕捉运动依赖的衣物褶皱。3)几何运动一致性学习,通过在关节噪声空间中定义的新型几何运动一致性损失,在帧间强制物理运动一致性。HumANDiff通过关节噪声采样微调视频扩散模型,实现了可扩展的可控人类视频生成。因此,我们的方法与扩散模型设计无关,无需修改模型架构。在推理过程中,HumANDiff在单一框架内实现图像到视频生成,在无需额外运动模块的情况下实现内在运动控制。大量实验表明,我们的方法在渲染运动一致、高保真度且具有多样化衣物风格的人类方面达到了最先进的性能。项目页面: https://taohuumd.github.io/projects/HumANDiff/。

关键词

引用

@article{arxiv.2604.05961,
  title  = {HumANDiff: Articulated Noise Diffusion for Motion-Consistent Human Video Generation},
  author = {Tao Hu and Varun Jampani},
  journal= {arXiv preprint arXiv:2604.05961},
  year   = {2026}
}

备注

Project page: https://taohuumd.github.io/projects/HumANDiff/