一种用于鸟瞰图语义分割推断的跨尺度分层Transformer与对应增强注意力方法
计算机视觉与模式识别
2023-08-21 v2
摘要
由于鸟瞰图(BEV)语义分割可视化简单且易于处理,它已被应用于自动驾驶中以向下游任务提供周围环境信息。基于多相机视角图像推断BEV语义分割因设备廉价且可实时处理而成为该领域的主流方案。近期工作通过视觉Transformer(ViT)学习内容与时位关系来实现该任务。然而,ViT的二次复杂度将关系学习局限于潜层,导致尺度差异阻碍细粒度目标的表征;且其多视角特征的朴素融合方式不符合表征BEV特征时的信息吸收意图。为解决这些问题,我们提出一种新颖的跨尺度分层Transformer与对应增强注意力用于语义分割推断。具体而言,我们设计分层框架以精炼BEV特征表征,其中最后尺寸仅为最终分割的一半。为节省该分层框架带来的计算增量,我们采用跨尺度Transformer以反向对齐方式学习特征关系,并利用BEV特征的残差连接促进尺度间信息传输。我们提出对应增强注意力以区分有益与无益对应。它以简单而有效的方式实现:在Softmax操作前放大注意力分数,从而凸显并抑制与位置-视角相关及无关的注意力分数。大量实验表明,我们的方法在基于多相机视角图像推断BEV语义分割上取得了最先进的性能。
引用
@article{arxiv.2304.03650,
title = {A Cross-Scale Hierarchical Transformer with Correspondence-Augmented Attention for inferring Bird's-Eye-View Semantic Segmentation},
author = {Naiyu Fang and Lemiao Qiu and Shuyou Zhang and Zili Wang and Kerui Hu and Kang Wang},
journal= {arXiv preprint arXiv:2304.03650},
year = {2023}
}