中文

基于 Transformer 显著性图的可解释多相机 3D 物体检测

计算机视觉与模式识别 2023-12-25 v1 机器学习

摘要

视觉 Transformer(ViTs)在各种计算机视觉任务(包括 3D 物体检测)中取得了最先进的结果。然而,其端到端的实现也使得 ViTs 的可解释性较差,这在自动驾驶等安全关键应用中的部署可能构成挑战,因为在这些应用中,监管机构、开发者和用户理解模型预测背后的推理至关重要。在本文中,我们提出了一种新方法,用于为具有多相机输入且用于 3D 物体检测的类 DetR ViT 生成显著性图。我们的方法基于原始注意力机制,比基于梯度的方法更高效。我们在 nuScenes 数据集上评估了所提出的方法,通过广泛的扰动测试表明,其在视觉质量和定量指标方面优于其他可解释性方法。我们还展示了聚合 Transformer 不同层注意力的重要性。我们的工作有助于 ViTs 可解释人工智能的发展,通过建立关于 AI 模型内部运作更高的透明度,帮助增加对 AI 应用的信任。

关键词

引用

@article{arxiv.2312.14606,
  title  = {Explainable Multi-Camera 3D Object Detection with Transformer-Based Saliency Maps},
  author = {Till Beemelmanns and Wassim Zahr and Lutz Eckstein},
  journal= {arXiv preprint arXiv:2312.14606},
  year   = {2023}
}