中文

SceMoS:基于几何 grounding token 的场景感知 3D 人体动作合成

计算机视觉与模式识别 2026-02-25 v1

摘要

合成包含语义意图(如"走向沙发")且符合物理法则(例如避免碰撞)的文本驱动 3D 人体动作是需要学习全局规划与局部接触推理的。当前方法使用生成式框架同时学习高层规划与低层接触推理,依赖计算密集的 3D 场景数据,如点云或体素占用网格。我们提出了 SceMoS,一种场景感知动作合成框架,表明结构化 2D 场景表示可以作为完整 3D 监督在物理 grounding 动作合成中的强大替代方案。SceMoS 通过轻量级 2D 线索将全局规划与局部执行解耦,具体包括:(1)基于鸟瞰视角(BEV)图像的文本条件自回归全局运动规划器,使用 DINOv2 特征编码作为场景表示;(2)基于几何 grounding 的动作标记器,通过条件 VQ-VAE 训练,利用 2D 局部场景高度图嵌入表面物理,直接离散化为词汇表。这种 2D 分解实现了效率与保真度之间的权衡:BEV 语义捕获空间布局和功能,为全局推理提供依据;而局部高度图确保细粒度物理一致性,无需完整的 3D 体素推理。SceMoS 在 TRUMANS 数据集上实现了最先进的动作真实性和接触精度,显示在场景编码中可省去超过 50%的可训练参数,表明 2D 场景线索能够有效地为 3D 人体-场景互动提供 grounding。

关键词

引用

@article{arxiv.2602.20476,
  title  = {SceMoS: Scene-Aware 3D Human Motion Synthesis by Planning with Geometry-Grounded Tokens},
  author = {Anindita Ghosh and Vladislav Golyanik and Taku Komura and Philipp Slusallek and Christian Theobalt and Rishabh Dabral},
  journal= {arXiv preprint arXiv:2602.20476},
  year   = {2026}
}

备注

13 pages, 6 figures, 4 tables