中文

面向可解释多模态传感器融合的分层模态分解

计算机视觉与模式识别 2025-11-04 v1

摘要

在自动驾驶领域,感知模型决策过程的透明性至关重要,因为即使单一次误感知也可能导致灾难性后果。然而,随着多传感器输入,由于传感器信息在融合网络中被缠合,难以确定每个模态如何贡献于预测。我们引入分层模态分解(LMD),这是一种后置的、通用模型无关的可解释性方法,用于在预训练的融合模型的所有层级上解缠模态特定信息。鉴于LMD是首个针对自动驾驶传感器融合系统中,为预测任务按输入模态归因的方法,我们对其有效性进行了评估。我们在相机-雷达、相机-LiDAR和相机-雷达-LiDAR三种设置下,对LMD在预训练的融合模型上的表现进行了评估。其有效性通过结构扰动基准指标和模态注意力分解进行验证,证明其在解释高容量多模态架构方面具有实际适用性。代码已公开于https://github.com/detxter-jvb/Layer-Wise-Modality-Decomposition。

关键词

引用

@article{arxiv.2511.00859,
  title  = {Layer-Wise Modality Decomposition for Interpretable Multimodal Sensor Fusion},
  author = {Jaehyun Park and Konyul Park and Daehun Kim and Junseo Park and Jun Won Choi},
  journal= {arXiv preprint arXiv:2511.00859},
  year   = {2025}
}

备注

Accepted to NeurIPS 2025