HUM3DIL:面向自动驾驶的半监督多模态三维人体姿态估计
计算机视觉与模式识别
2022-12-16 v1
摘要
自动驾驶是一个令人振奋的新兴产业,提出了重要的研究问题。在感知模块中,三维人体姿态估计是一项新兴技术,可使自动驾驶车辆感知并理解行人细微而复杂的行为。尽管数十年来硬件系统与传感器已取得显著进步——汽车可能配备复杂的LiDAR与视觉系统,且针对这些新信息的专用数据集不断扩充——但利用这些新信号解决三维人体姿态估计核心问题的工作仍十分有限。我们提出的方法HUM3DIL(HUMan 3D from Images and LiDAR)以半监督方式高效利用这些互补信号,并以大幅优势超越现有方法。它是一个可车载部署的快速紧凑模型。具体而言,我们将LiDAR点嵌入像素对齐的多模态特征中,并通过一系列Transformer精炼阶段。在Waymo Open Dataset上的定量实验支持了上述结论,我们在三维姿态估计任务上取得了SOTA结果。
引用
@article{arxiv.2212.07729,
title = {HUM3DIL: Semi-supervised Multi-modal 3D Human Pose Estimation for Autonomous Driving},
author = {Andrei Zanfir and Mihai Zanfir and Alexander Gorban and Jingwei Ji and Yin Zhou and Dragomir Anguelov and Cristian Sminchisescu},
journal= {arXiv preprint arXiv:2212.07729},
year = {2022}
}
备注
Published at the 6th Conference on Robot Learning (CoRL 2022), Auckland, New Zealand