中文

推理能否改善行人意图估计?一种跨模态方法

计算机视觉与模式识别 2024-11-21 v1

摘要

随着自主导航系统重要性的提升,保护诸如行人等弱势道路使用者(VRUs)的安全的需求也日益增加。预测行人意图是一项具有挑战性的任务,先前的工作通过融合视觉与运动特征来预测二元的横穿/不横穿意图。然而,迄今为止尚无努力用人类可理解的推理来为这类预测提供保障。我们通过引入探索行人意图背后直觉推理的新问题设定来解决这一问题。具体而言,我们表明预测“为什么”对于理解“是什么”非常有用。为此,我们提出了一个新颖的、富含推理的 PIE++ 数据集,其中包含针对行人意图的多标签文本解释/推理。我们还引入了一个名为 MINDREAD 的新型多任务学习框架,该框架利用跨模态表示学习框架来预测行人意图及其背后的推理。我们的综合实验表明,在 PIE++ 数据集上使用 MINDREAD 进行意图预测任务时,准确率和 F1 分数分别显著提升了 5.6% 和 7%。我们还在常用的 JAAD 数据集上实现了 4.4% 的准确率提升。使用定量/定性指标和用户研究的广泛评估表明了我们方法的有效性。

关键词

引用

@article{arxiv.2411.13302,
  title  = {Can Reasons Help Improve Pedestrian Intent Estimation? A Cross-Modal Approach},
  author = {Vaishnavi Khindkar and Vineeth Balasubramanian and Chetan Arora and Anbumani Subramanian and C. V. Jawahar},
  journal= {arXiv preprint arXiv:2411.13302},
  year   = {2024}
}