基于单目视觉的统一人体定位与轨迹预测
计算机视觉与模式识别
2025-03-06 v1 机器人学
摘要
传统的人体轨迹预测模型依赖干净的人工标注数据,需要专用设备或人工标注,这在机器人应用中往往不切实际。现有的预测器容易对干净观测过拟合,导致在噪声输入下鲁棒性不足。在本工作中,我们提出MonoTransmotion(MT),一个基于Transformer的框架,仅使用单目相机联合解决定位与预测任务。我们的框架包含两个主要模块:鸟瞰图(BEV)定位和轨迹预测。BEV定位模块利用2D人体姿态估计人体位置,并通过一种新颖的方向性损失函数实现更平滑的序列定位。轨迹预测模块基于这些估计预测未来运动。我们表明,通过统一框架联合训练两个任务,我们的方法在由噪声输入组成的真实场景中更加鲁棒。我们在整理数据集和非整理数据集上验证了MT网络。在整理数据集上,MT在BEV定位和轨迹预测上相比基线模型实现了约12%的提升。在真实非整理数据集上,实验结果表明MT保持了相似的性能水平,突显了其鲁棒性和泛化能力。代码地址:https://github.com/vita-epfl/MonoTransmotion。
引用
@article{arxiv.2503.03535,
title = {Unified Human Localization and Trajectory Prediction with Monocular Vision},
author = {Po-Chien Luan and Yang Gao and Celine Demonsant and Alexandre Alahi},
journal= {arXiv preprint arXiv:2503.03535},
year = {2025}
}
备注
ICRA 2025