基于统一场景语义占有率的 3D 场景中人类运动合成
计算机视觉与模式识别
2025-11-12 v1
摘要
3D 场景中的人类运动合成高度依赖场景理解, 而当前方法主要关注场景结构, 忽略了语义理解。在本文中, 我们提出一种人类运动合成框架, 使用统一场景语义占有率 (SSO) 进行场景表示, 称为 SSOMotion。我们设计一种双向三平面分解以派生 SSO 的紧凑版本, 并通过 CLIP 编码和共享线性降维将场景语义映射到统一特征空间。此策略可在显著减少冗余计算的同时, 派生细粒度场景语义结构。我们进一步利用这些场景线索和来自指令的运动方向进行帧级场景查询以实现运动控制。在使用 ShapeNet 家具、PROX 和 Replica 数据集中的杂乱场景进行的大量实验和消融研究表明, 该方法在性能上领先且验证了其有效性和泛化能力。代码将在 https://github.com/jingyugong/SSOMotion 上公开。
引用
@article{arxiv.2511.07819,
title = {Human Motion Synthesis in 3D Scenes via Unified Scene Semantic Occupancy},
author = {Gong Jingyu and Tong Kunkun and Chen Zhuoran and Yuan Chuanhan and Chen Mingang and Zhang Zhizhong and Tan Xin and Xie Yuan},
journal= {arXiv preprint arXiv:2511.07819},
year = {2025}
}