中文

MTevent:面向6D姿态估计和移动物体检测的多任务事件相机数据集

计算机视觉与模式识别 2025-06-04 v2

摘要

移动机器人正达到前所未有的速度,平台如Unitree B2和Fraunhofer O3dyn实现最高速度在5至10米/秒之间。然而,有效利用这些速度仍具有挑战,因为RGB相机存在运动模糊,难以提供实时响应。事件相机凭借其异步操作和低延迟感知,为高速机器人感知提供了有前景的替代方案。本文介绍MTevent,一个用于高度动态环境中6D姿态估计和移动物体检测的数据集,具有较大的检测距离。我们的设置包括立体事件相机和RGB相机,捕获75个场景,每个场景平均持续16秒,包含16个独特物体,面临极端视角、变化照明和遮挡等挑战条件。MTevent是首个将高速运动、远距离感知和真实物体交互组合在一起的数据集,为推动事件基础视觉在机器人领域的发展提供了宝贵资源。为建立基线,我们评估了使用NVIDIA的FoundationPose在RGB图像上进行6D姿态估计的任务,实现平均召回率为0.22(使用真实掩码),凸显了基于RGB的方法在此类动态环境中的局限性。随着MTevent的提供,我们提供了一种新资源,以改进感知模型并推动高速机器人视觉的进一步研究。数据集可在https://huggingface.co/datasets/anas-gouda/MTevent 下载。

关键词

引用

@article{arxiv.2505.11282,
  title  = {MTevent: A Multi-Task Event Camera Dataset for 6D Pose Estimation and Moving Object Detection},
  author = {Shrutarv Awasthi and Anas Gouda and Sven Franke and Jérôme Rutinowski and Frank Hoffmann and Moritz Roidl},
  journal= {arXiv preprint arXiv:2505.11282},
  year   = {2025}
}

备注

Accepted at 2025 IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW); Fifth International Workshop on Event-Based Vision