用于目标检测的视觉 Transformer 训练策略
计算机视觉与模式识别
2023-04-06 v1
摘要
基于视觉的 Transformer 由于在建模视觉特征间长程依赖方面的强大能力,在自动驾驶感知模块中预测精确 3D 边界框方面已展现出巨大应用价值。然而,最初为语言模型设计的 Transformer 大多关注性能精度,而非推理时间预算。对于像自动驾驶这样的安全关键系统,车载计算平台的实时推理是绝对必要的。这使我们的目标检测算法处于非常紧张的运行时预算之下。在本文中,我们评估了多种策略,以在密切关注任何性能变化的同时优化基于视觉 Transformer 的目标检测方法的推理时间。我们针对这些策略所选用的指标是精度-运行时联合优化。此外,为了实际的推理时间分析,我们使用 TensorRT 模块以 float32 和 float16 精度对我们的策略进行性能剖析。这是工业界将其机器学习网络部署到边缘设备最常用的格式。我们展示了我们的策略能够将该问题定义(见评估章节)下的推理时间提升 63%,而性能下降仅 3%。这些策略使视觉 Transformer 检测器的推理时间甚至低于传统的基于单图像的 CNN 检测器(如 FCOS)。我们建议实践者使用这些技术,在预算受限的机器人平台上部署基于 Transformer 的庞大多视角网络。
引用
@article{arxiv.2304.02186,
title = {Training Strategies for Vision Transformers for Object Detection},
author = {Apoorv Singh},
journal= {arXiv preprint arXiv:2304.02186},
year = {2023}
}
备注
9 pages, 2 figures, IEEE CVPR WAD'23 conference