中文

EffiPerception:面向多种感知任务的高效框架

计算机视觉与模式识别 2024-03-20 v1

摘要

精度-速度-内存的权衡始终是多种计算机视觉感知任务优先考虑的问题。以往方法主要聚焦于单一或少数几个任务,例如创建有效的数据增强、特征提取器、学习策略等。然而,这些方法可能本质上是任务特定的:其所提模型的性能可能依赖于特定的感知任务或数据集。为探索通用学习模式并增强模块鲁棒性,我们提出了 EffiPerception 框架。该框架能够在 2D 目标检测、3D 目标检测、2D 实例分割和 3D 点云分割等多种感知任务下,以相对较低的内存开销实现优异的精度-速度性能。整体框架由三部分组成:(1)高效特征提取器,为每种模态提取输入特征。(2)高效层,即插即用的层,进一步处理特征表示,聚合核心学习信息同时剪除噪声提议。(3)EffiOptim,一种 8 位优化器,进一步降低计算成本并提升性能稳定性。在 KITTI、semantic-KITTI 和 COCO 数据集上的大量实验表明,与早期备受推崇的方法相比,EffiPerception 在四项检测与分割任务中均能展现出显著的精度-速度-内存综合性能提升。

关键词

引用

@article{arxiv.2403.12317,
  title  = {EffiPerception: an Efficient Framework for Various Perception Tasks},
  author = {Xinhao Xiang and Simon Dräger and Jiawei Zhang},
  journal= {arXiv preprint arXiv:2403.12317},
  year   = {2024}
}