Laneformer:用于车道检测的对象感知行列 Transformer
计算机视觉与模式识别
2022-03-21 v1
摘要
我们提出 Laneformer,一种概念简洁却强大的基于 transformer 的车道检测架构,车道检测是自动驾驶视觉感知中一个长期的研究课题。主流范式依赖纯 CNN 架构,往往难以融入长程车道点关系及由周围对象(如行人、车辆)引发的全局上下文。受近期 transformer 编码器-解码器架构在各类视觉任务中进展的启发,我们进一步设计了一种全新的端到端 Laneformer 架构,其将传统 transformer 革新为更好地捕捉车道的形状与语义特征,且延迟开销极小。首先,结合编码器中可形变逐像素自注意力,Laneformer 提出两种新的行与列自注意力操作,以沿车道形状高效挖掘点上下文。其次,受出现对象会影响车道段预测决策这一动机驱动,Laneformer 进一步将检测到的对象实例作为编码器与解码器中多头注意力块的额外输入,通过感知语义上下文来促进车道点检测。具体而言,对象的边界框位置被加入 Key 模块以提供与每个像素及 query 的交互,而 ROI-aligned 特征被插入 Value 模块。大量实验表明,我们的 Laneformer 在 CULane 基准上以 77.1% 的 F1 分数取得了最先进性能。我们希望这一简洁有效的 Laneformer 能作为未来车道检测自注意力模型研究的强基线。
引用
@article{arxiv.2203.09830,
title = {Laneformer: Object-aware Row-Column Transformers for Lane Detection},
author = {Jianhua Han and Xiajun Deng and Xinyue Cai and Zhen Yang and Hang Xu and Chunjing Xu and Xiaodan Liang},
journal= {arXiv preprint arXiv:2203.09830},
year = {2022}
}
备注
AAAI2022