面向实时目标检测的多模态自助餐策略
机器学习
2020-11-18 v1 计算机视觉与模式识别
机器人学
摘要
在轻量级硬件上利用视频进行实时目标检测是许多机器人任务的关键组成部分。使用不同模态且计算复杂度各异的检测器提供了不同的权衡。一种选择是采用非常轻量的模型,对每一帧一次性从所有模态进行预测。然而,在某些情形(例如静态场景)下,采用更复杂但更精确的模型,并对处理时到达的帧基于先前的预测进行外推可能更优。我们将此任务表述为序贯决策问题,并使用强化学习(RL)生成策略,该策略根据 RGB 输入决定从一组不同目标检测器组合中选取哪一个用于下一次预测。RL 智能体的目标是最大化每幅图像预测的准确率。我们在 Waymo Open Dataset 上评估该方法,并表明其超越了每一个单一检测器的性能。
引用
@article{arxiv.2011.08726,
title = {Modality-Buffet for Real-Time Object Detection},
author = {Nicolai Dorka and Johannes Meyer and Wolfram Burgard},
journal= {arXiv preprint arXiv:2011.08726},
year = {2020}
}
备注
Accepted at the 2020 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)