基于 MulCPred 的多模态概念学习,用于可解释行人动作预测
计算机视觉与模式识别
2024-09-17 v1 人工智能
摘要
行人动作预测对于许多应用(如自动驾驶)至关重要。然而,现有方法缺乏可解释性以作出可信预测。本文提出了一种新型框架,称为 MulCPred,其预测基于由训练样本表示的多模态概念。以往的概念-based 方法存在局限性:1) 不能直接应用于多模态情况;2) lacks 对局部性以关注输入中的细节;3) suffer 从模式崩溃。针对这些局限性,我们提出了以下方法:1) 一个线性聚合器将概念的激活结果整合到预测中,将不同模态的概念关联起来,并提供 ante-hoc 解释概念与预测之间的相关性;2) 一个通道级再调制模块以关注局部时空区域,使概念具有局部性;3) 一个特征正则化损失鼓励概念学习多样化模式。MulCPred 在多个数据集和任务上进行评估。定性和定量结果表明,MulCPred 在不明显性能下降的情况下提高了行人动作预测的可解释性。此外,通过移除 MulCPred 中不可识别的概念,可提高跨数据集预测性能,表明 MulCPred 的进一步通用性是可行的。
引用
@article{arxiv.2409.09446,
title = {MulCPred: Learning Multi-modal Concepts for Explainable Pedestrian Action Prediction},
author = {Yan Feng and Alexander Carballo and Keisuke Fujii and Robin Karlsson and Ming Ding and Kazuya Takeda},
journal= {arXiv preprint arXiv:2409.09446},
year = {2024}
}