面向可解释多模态传感器融合的分层模态分解
计算机视觉与模式识别
2025-11-04 v1
摘要
在自动驾驶领域,感知模型决策过程的透明性至关重要,因为即使单一次误感知也可能导致灾难性后果。然而,随着多传感器输入,由于传感器信息在融合网络中被缠合,难以确定每个模态如何贡献于预测。我们引入分层模态分解(LMD),这是一种后置的、通用模型无关的可解释性方法,用于在预训练的融合模型的所有层级上解缠模态特定信息。鉴于LMD是首个针对自动驾驶传感器融合系统中,为预测任务按输入模态归因的方法,我们对其有效性进行了评估。我们在相机-雷达、相机-LiDAR和相机-雷达-LiDAR三种设置下,对LMD在预训练的融合模型上的表现进行了评估。其有效性通过结构扰动基准指标和模态注意力分解进行验证,证明其在解释高容量多模态架构方面具有实际适用性。代码已公开于https://github.com/detxter-jvb/Layer-Wise-Modality-Decomposition。
引用
@article{arxiv.2511.00859,
title = {Layer-Wise Modality Decomposition for Interpretable Multimodal Sensor Fusion},
author = {Jaehyun Park and Konyul Park and Daehun Kim and Junseo Park and Jun Won Choi},
journal= {arXiv preprint arXiv:2511.00859},
year = {2025}
}
备注
Accepted to NeurIPS 2025