中文

理解以自身为中心的动态 4D 点云场景

计算机视觉与模式识别 2025-11-18 v3

摘要

从自中心视角理解动态 4D 场景——即随时间变化的 3D 空间结构建模——对于人机交互、自动导航和具身智能至关重要。虽然现有自中心数据集包含动态场景,但缺乏统一的 4D 标注以及面向细粒度时空推理的任务驱动评估协议,尤其是针对物体和人类运动及其相互作用。为填补这一差距,我们引入 EgoDynamic4D,一个聚焦于高度动态场景的新型问答基准,包含 RGB-D 视频、相机姿态、全局唯一实例掩码以及 4D 边界框。我们构建了 92.7 万组 QA 对,配有显式的链式思考 (Chain-of-Thought, CoT),以实现可验证的、逐步的时空推理。我们设计了 12 个动态 QA 任务,覆盖代理运动、人机交互、�迹预测、关系理解和时序因果推理,采用细粒度、多维度指标。为解决这些任务,我们提出了一个端到端的时空推理框架,统一动态与静态场景信息,采用实例感知特征编码、时间和相机编码,以及空间自适应下采样,将大规模 4D 场景压缩为 LLM 可管理的 token 序列。在 EgoDynamic4D 上的实验表明,我们的方法在基线上 consistently 获胜,验证了多模态时序建模对于自中心动态场景理解的有效性。

关键词

引用

@article{arxiv.2508.07251,
  title  = {Understanding Dynamic Scenes in Ego Centric 4D Point Clouds},
  author = {Junsheng Huang and Shengyu Hao and Bocheng Hu and Hongwei Wang and Gaoang Wang},
  journal= {arXiv preprint arXiv:2508.07251},
  year   = {2025}
}

备注

Accepted as a poster to AAAI 2026; will be published in the proceedings