中文

基于鸟瞰视图表示的内容感知多模态联合输入剪枝

计算机视觉与模式识别 2024-10-11 v1 人工智能

摘要

在自动驾驶领域,鸟瞰视图(BEV)表示最近已引起大量学术关注,作为传感器输入融合的变革性框架。该 BEV 范式有效地将传感器融合挑战从基于规则的方法转变为数据中心的方法,从而促进了来自异构传感器阵列的更细致特征提取。尽管其显著优势是显而易见的,BEV 技术相关的计算开销往往需要高容量硬件基础设施,从而给实际现实实施提出了挑战。为缓解这一限制,我们引入一种新颖的内容感知多模态联合输入剪枝技术。我们的方法将 BEV 作为共享锚点,算法性地识别并消除进入感知模型主干之前的非本质传感器区域。我们通过 NuScenes 数据集上的大量实验验证了该方法的有效性,显示出在不牺牲感知精度方面的显著计算效率。就已知最好的方法而言,本工作代表了从输入剪枝点消除计算负担的首次尝试。

关键词

引用

@article{arxiv.2410.07268,
  title  = {Learning Content-Aware Multi-Modal Joint Input Pruning via Bird's-Eye-View Representation},
  author = {Yuxin Li and Yiheng Li and Xulei Yang and Mengying Yu and Zihang Huang and Xiaojun Wu and Chai Kiat Yeo},
  journal= {arXiv preprint arXiv:2410.07268},
  year   = {2024}
}