中文

FOVEA:用于自主导航的中央凹式图像放大

计算机视觉与模式识别 2021-10-12 v2

摘要

高效处理高分辨率视频流对自动驾驶等许多机器人应用的安全至关重要。为保持实时性能,许多实用系统对视频流进行下采样,但这会损害下游任务(如小物体检测)的效果。相反,我们从生物视觉系统汲取灵感,其对场景显著部分分配更多中央凹“像素”。我们提出 FOVEA,一种智能下采样方法,确保显著图像区域在下采样输出中保持“放大”。给定高分辨率图像,FOVEA 应用可微分重采样层输出固定尺寸的小图像画布,随后由可微分视觉模块(如物体检测网络)处理,其输出再可微分地反向映射回原始图像尺寸。核心思想在于重采样时背景像素可为感兴趣的显著像素腾出空间。为保障整体流水线高效,FOVEA 利用廉价且易得的显著性线索,包括数据集特定的空间先验或根据近期物体预测得到的时间先验。在自动驾驶数据集 Argoverse-HD 与 BDD100K 上,我们提出的方法在标准 Faster R-CNN 基础上提升了检测 AP,无论是否微调。在计算量无明显增加的情况下,我们将小物体精度提升超过 2 倍且不降低大物体性能。最终,FOVEA 在流式 AP 上创下新高(在 GTX 1080 Ti GPU 上从 17.8 提升至 23.0),该指标旨在同时刻画精度与延迟。

关键词

引用

@article{arxiv.2108.12102,
  title  = {FOVEA: Foveated Image Magnification for Autonomous Navigation},
  author = {Chittesh Thavamani and Mengtian Li and Nicolas Cebron and Deva Ramanan},
  journal= {arXiv preprint arXiv:2108.12102},
  year   = {2021}
}

备注

ICCV 2021. Code can be found on the project page at https://www.cs.cmu.edu/~mengtial/proj/fovea/