中文

基于自注意力的 RGB-事件融合用于碰撞预测

机器人学 2025-05-19 v2 计算机视觉与模式识别

摘要

确保鲁棒且实时的避障对于自主机器人在动态真实世界环境中的安全运行至关重要。本文提出了一种神经网络框架,利用 RGB 和事件视觉传感器预测无人机与动态物体的碰撞时间和位置。所提出的架构由两个独立的编码器分支组成,每种模态一个,随后通过自注意力进行融合以提高预测精度。为了便于基准测试,我们利用了收集的 ABCD [8] 数据集,该数据集能够对单模态和基于融合的方法进行详细比较。在相同的 50Hz 预测吞吐量下,实验结果表明,基于融合的模型在预测精度上比单模态方法平均提高了 1%,在距离超过 0.5m 时提高了 10%,但代价是内存增加 71%,FLOPs 增加 105%。值得注意的是,在相似的计算成本下,基于事件的模型在位置误差上比 RGB 模型低 4%,在时间误差上低 26%,使其成为一个有竞争力的替代方案。此外,我们评估了事件模型的量化版本,应用 1 到 8 位量化来评估预测性能与计算效率之间的权衡。这些发现突显了在机器人应用中使用 RGB 和事件相机进行多模态感知的权衡。

关键词

引用

@article{arxiv.2505.04258,
  title  = {RGB-Event Fusion with Self-Attention for Collision Prediction},
  author = {Pietro Bonazzi and Christian Vogt and Michael Jost and Haotong Qin and Lyes Khacef and Federico Paredes-Valles and Michele Magno},
  journal= {arXiv preprint arXiv:2505.04258},
  year   = {2025}
}

备注

arXiv admin note: text overlap with arXiv:2504.10400