中文

VOccl3D:基于视频的3D人体姿态与形状估计实况遮挡基准数据集

计算机视觉与模式识别 2025-09-18 v1 图形学

摘要

人体姿态与形状(HPS)估计方法已得到广泛研究,许多方法在野外图像和视频上表现出高零样本性能。然而,这些方法在涉及复杂人体姿态或显著遮挡的挑战场景中常常难以克服。虽然一些研究针对遮挡下的3D人体姿态估计,但通常在缺乏真实或大量遮挡的数据集上进行评估,例如大多数现有数据集通过在人体上添加随机遮罩或剪贴画样式遮挡来引入遮挡,这可能不反映真实世界的挑战。为填补现实遮挡数据集的空白,我们引入了新型基准数据集VOccl3D(Video-based human Occlusion dataset with 3D body pose and shape annotations),其包含视频格式的人体遮挡数据及3D姿态和形状标注。灵感来自AGORA和BEDLAM等工作,我们采用先进的计算机图形渲染技术构建该数据集,包含多样化的真实世界遮挡场景、服装纹理和人体动作。此外,我们对最近的HPS方法(如CLiff和BEDLAM-CLiff)在该数据集上进行微调,展示了在多个公开数据集以及VOccl3D数据集测试分割上的显著定性和定量改进,同时与其他最新方法进行比较。进一步,我们利用该数据集通过微调现有目标检测器(如YOLO11)来增强遮挡下的人体检测性能,从而构建起一个稳健的端到端HPS估计系统。总体而言,该数据集为未来旨在构建处理遮挡方法的基准研究提供了宝贵资源,为现有遮挡数据集提供了更真实的替代方案。项目页面可见:https://yashgarg98.github.io/VOccl3D-dataset/

关键词

引用

@article{arxiv.2508.06757,
  title  = {VOccl3D: A Video Benchmark Dataset for 3D Human Pose and Shape Estimation under real Occlusions},
  author = {Yash Garg and Saketh Bachu and Arindam Dutta and Rohit Lal and Sarosij Bose and Calvin-Khang Ta and M. Salman Asif and Amit Roy-Chowdhury},
  journal= {arXiv preprint arXiv:2508.06757},
  year   = {2025}
}