中文

Stable Part Diffusion 4D:多视角RGB与运动部件视频生成

计算机视觉与模式识别 2025-11-06 v2

摘要

我们提出了 Stable Part Diffusion 4D (SP4D),一个从单目输入生成配对RGB和运动部件视频的框架。与依赖外观语义线索的传统部件分割方法不同,SP4D 学习生成运动部件——即与物体关节运动对齐且在视角和时间上保持一致的结构组件。SP4D 采用双分支扩散模型,联合合成RGB帧和对应的部件分割图。为了简化架构并灵活支持不同的部件数量,我们引入了一种空间颜色编码方案,将部件掩码映射到连续的类RGB图像。这种编码允许分割分支共享RGB分支的潜在VAE,同时使得部件分割能够通过直接的后处理恢复。一个双向扩散融合(BiDiFuse)模块增强了跨分支的一致性,并由对比部件一致性损失支持,以促进部件预测的空间和时间对齐。我们证明,生成的2D部件图可以提升到3D,从而通过少量手动调整推导出骨骼结构和调和蒙皮权重。为了训练和评估SP4D,我们构建了KinematicParts20K,这是一个从Objaverse XL(Deitke et al., 2023)中筛选和处理出的超过2万个绑定物体的精选数据集,每个物体都配有多视角RGB和部件视频序列。实验表明,SP4D 对各种场景具有很强的泛化能力,包括真实世界视频、新生成的物体和罕见的关节姿态,产生适用于下游动画和运动相关任务的运动感知输出。

关键词

引用

@article{arxiv.2509.10687,
  title  = {Stable Part Diffusion 4D: Multi-View RGB and Kinematic Parts Video Generation},
  author = {Hao Zhang and Chun-Han Yao and Simon Donné and Narendra Ahuja and Varun Jampani},
  journal= {arXiv preprint arXiv:2509.10687},
  year   = {2025}
}

备注

Page: https://stablepartdiffusion4d.github.io/