中文

Waymo-3DSkelMo:面向自动驾驶中行人交互建模的多代理 3D 骨骼运动数据集

计算机视觉与模式识别 2025-08-14 v1 多媒体

摘要

大规模高质量的多人交互 3D 动作数据集是数据驱动模型在复杂城市环境中实现精细化行人交互理解的关键。然而,现有数据集大多依赖从单目 RGB 视频帧中估计 3D 姿态,存在遮挡问题和时序连续性不足,导致人体运动不真实且质量较低。为此,本文引入 Waymo-3DSkelMo,首个提供高质量、时序连贯 3D 骨骼运动并显式包含交互语义的数据集,数据来源于 Waymo 感知数据集。我们的核心思路是利用 3D 人体形状与运动先验,提升从原始 LiDAR 点云中提取的 3D 姿态序列质量。该数据集覆盖超过 800 个真实驾驶情景,累计超过 14,000 秒,包含平均 27 个代理人(最高场景达 250 个代理人)的丰富交互。进一步建立了在不同行人密度下的 3D 姿态预测基准测试,结果证明其作为复杂城市环境中精细化人类行为理解的基础资源具有重要价值。数据集与代码将于 https://github.com/GuangxunZhu/Waymo-3DSkelMo 发布。

关键词

引用

@article{arxiv.2508.09404,
  title  = {Waymo-3DSkelMo: A Multi-Agent 3D Skeletal Motion Dataset for Pedestrian Interaction Modeling in Autonomous Driving},
  author = {Guangxun Zhu and Shiyu Fan and Hang Dai and Edmond S. L. Ho},
  journal= {arXiv preprint arXiv:2508.09404},
  year   = {2025}
}

备注

ACM Multimedia 2025 (Dataset Track) Paper