中文

用于可解释自动驾驶的推理诱导视觉注意力

计算机视觉与模式识别 2021-10-15 v1

摘要

基于深度学习(DL)的计算机视觉(CV)模型由于可解释性差,通常被认为是黑盒。这一局限性阻碍了对系统故障的有效诊断或预测,从而排除了将 DLCV 模型广泛应用于自动驾驶等安全关键任务的可能性。本研究出于增强自动驾驶中 DL 模型可解释性的需求,提出了一种可解释的基于 DL 的框架,该框架生成驾驶环境的文本描述,并基于生成的描述做出适当决策。所提出的框架通过联合建模视觉输入(图像)和自然语言来模仿人类驾驶员的学习过程,同时利用语言诱导图像中的视觉注意力。结果表明,通过聚焦于视觉输入中的相关特征,所获得的自动驾驶决策具有很强的可解释性。此外,输出的注意力图不仅通过为模型行为提供有意义的解释,还通过指出模型的弱点及潜在改进方向,增强了模型的可解释性。

关键词

引用

@article{arxiv.2110.07380,
  title  = {Reason induced visual attention for explainable autonomous driving},
  author = {Sikai Chen and Jiqian Dong and Runjia Du and Yujie Li and Samuel Labi},
  journal= {arXiv preprint arXiv:2110.07380},
  year   = {2021}
}

备注

Under review for presentation at TRB 2022 Annual Meeting