中文

ViPS:用于自拟人化网格的视频信息姿态空间

计算机视觉与模式识别 2026-05-22 v3 图形学

摘要

运动学 rig 为 articulating 3D 网格提供了结构化接口,但缺乏与之关联的姿态空间,即针对给定网格的有效关节配置可行流形的显式表示。缺乏姿态空间时,随机采样或手动操作原始 rig 参数容易导致语义和/或几何违规,如解剖学过伸和非物理自相交。我们提出视频信息姿态空间(Video-informed Pose Spaces, ViPS),一种前馈框架,通过从预训练视频扩散模型提炼运动先验来发现给定自拟人化网格的有效 articulation 潜在分布。不同于依赖稀缺艺术家编写 4D 数据集或聚焦于重建单个运动实例的现有方法,ViPS 将生成式视频模型的先验迁移到给定 rig 参数化的通用分布中。应用于 skinned 网格的可微几何验证器确保特定形状的完整性,无需手动正则化器。我们的前馈模型揭示了平滑、紧凑且可控的姿态空间,从而支持多样化形状变体的采样、逆向运动学的流形投影以及动画和关键帧的时序一致轨迹。进一步,提炼出的 3D 姿态样本作为语义代理指导视频扩散,有效闭合了生成式 2D 先验与结构化 3D 运动控制之间的循环。我们的评估表明,ViPS 仅使用视频先验训练,即可在可行性和多样性方面匹配最先进模型在合成艺术家创建 4D 数据集上的性能。此外,作为通用模型,ViPS 对超出分布的物种和不可见骨骼拓扑展现出稳健的零样本泛化能力。

关键词

引用

@article{arxiv.2604.17623,
  title  = {ViPS: Video-informed Pose Spaces for Auto-Rigged Meshes},
  author = {Honglin Chen and Karran Pandey and Rundi Wu and Matheus Gadelha and Yannick Hold-Geoffroy and Ayush Tewari and Niloy J. Mitra and Changxi Zheng and Paul Guerrero},
  journal= {arXiv preprint arXiv:2604.17623},
  year   = {2026}
}

备注

Project page: https://honglin-c.github.io/vips/