中文

基于视觉的行人动作预测模型分析

计算机视觉与模式识别 2023-05-30 v1

摘要

在自动驾驶车辆前 anticipating 人类动作是一项具挑战性的任务。近期若干论文提出结合多种输入特征以预测行人横穿动作的模型架构来解决该问题。本文专门聚焦于使用行人上下文图像作为输入特征。我们提出若干利用标准 CNN 与 Transformer 模块的时空模型架构,作为行人动作预测的骨干网络。然而,本文目标并非超越最先进基准,而是分析这些模型的正向与负向预测。因此,我们针对基于视觉的 Transformer 模型在行人动作预测上下文中的可解释性提供见解。我们将突出模型可取得正确定量结果却在定性上缺乏类人解释的案例,强调为行人动作预测问题投入可解释性研究的重要性。

关键词

引用

@article{arxiv.2305.17451,
  title  = {Analysis over vision-based models for pedestrian action anticipation},
  author = {Lina Achaji and Julien Moreau and François Aioun and François Charpillet},
  journal= {arXiv preprint arXiv:2305.17451},
  year   = {2023}
}