面向对象感知的 4D 人体动作生成
计算机视觉与模式识别
2025-11-04 v1 图形学
摘要
近期视频扩散模型的进展已实现高质量视频的生成。然而,这些视频仍存在不真实的变形、语义违规和物理不一致的问题,这些问题很大程度上源于缺乏 3D 物理先验。为解决这些挑战,我们提出一种基于 3D 高斯表示和动作扩散先验的对象感知 4D 人体动作生成框架。通过预生成的 3D 人体与物体,Our 方法——Motion Score Distilled Interaction (MSDI),运用大型语言模型 (LLM) 中的空间信息和提示语义信息,结合动作先验,通过提出的 Motion Diffusion Score Distillation Sampling (MSDS) 来实现。MSDS 与 LLM 的结合使我们的空间感知动作优化得以实现,通过从预训练动作扩散模型中提取得分梯度,以此来细化人体动作,同时尊重物体和语义约束。不同于以往需在有限交互数据集上进行联合训练的方法,Our 零样本方法无需重新训练即可针对超出分布的对象感知人体动作进行泛化。实验表明,我们的框架产生自然且在物理上合理的人体动作,尊重 3D 空间语境,为实现可扩展的真实 4D 生成提供了解决方案。
引用
@article{arxiv.2511.00248,
title = {Object-Aware 4D Human Motion Generation},
author = {Shurui Gui and Deep Anil Patel and Xiner Li and Martin Renqiang Min},
journal= {arXiv preprint arXiv:2511.00248},
year = {2025}
}