中文

HFT:通过混合特征变换提升透视表征

计算机视觉与模式识别 2022-04-12 v1

摘要

自动驾驶需要准确而精细的鸟瞰图(BEV)语义分割以进行决策,这是高级场景感知中最具挑战性的任务之一。从正视视图到BEV的特征变换是BEV语义分割的关键技术。现有工作可大致分为两类,即基于相机模型的特征变换(CBFT)与无相机模型的特征变换(CFFT)。本文中,我们实证分析了CBFT与CFFT之间的关键差异。前者基于平地假设变换特征,可能导致位于地平面上方区域的畸变。后者因缺乏几何先验与计算耗时而在分割性能上受限。为兼取CBFT与CFFT之长并避其短,我们提出一种带有混合特征变换模块(HFT)的新框架。具体而言,我们解耦HFT生成的特征图以估计BEV中室外场景的布局。此外,我们设计了一种互学习方案,通过特征模仿来增强混合变换。值得注意的是,大量实验表明,相较最佳现有方法,HFT在Argoverse数据集上取得13.3%的相对提升,在KITTI 3D Object数据集上取得16.8%的相对提升,且额外开销可忽略。代码见 https://github.com/JiayuZou2020/HFT。

关键词

引用

@article{arxiv.2204.05068,
  title  = {HFT: Lifting Perspective Representations via Hybrid Feature Transformation},
  author = {Jiayu Zou and Junrui Xiao and Zheng Zhu and Junjie Huang and Guan Huang and Dalong Du and Xingang Wang},
  journal= {arXiv preprint arXiv:2204.05068},
  year   = {2022}
}