多模态变换器中的特征级交互解释
机器学习
2026-03-17 v1 人工智能
摘要
多模态变换器通常在不阐明不同模态如何联合支持决策的情况下产生预测。大多数现有的多模态可解释AI(MXAI)方法将单模态显著性扩展到多模态骨干网络,高亮每个模态中的重要token或补丁,但它们很少指出哪些跨模态特征对提供互补证据(协同)或充当可靠备份(冗余)。我们提出了特征级I2MoE(FL-I2MoE),一种直接作用于来自冻结预训练编码器的token/补丁序列的结构化混合专家层,并在特征层面明确分离独特、协同和冗余证据。我们进一步开发了一个专家级解释管道,结合归因与top-K%掩码来评估保真度,并引入蒙特卡洛交互探针来量化成对行为:Shapley交互指数(SII)用于评分协同对,冗余差距分数用于捕获可替代的(冗余的)对。在三个基准(MMIMDb、ENRICO和MMHS150K)上,FL-I2MoE产生了比具有相同编码器的密集变换器更具交互特异性和集中性的重要性模式。最后,成对掩码表明,按SII或冗余差距分数排序的对的移除比在相同预算下随机选择的对的移除对性能的损害更大,支持所识别的交互具有因果相关性。
引用
@article{arxiv.2603.13326,
title = {Feature-level Interaction Explanations in Multimodal Transformers},
author = {Yeji Kim and Housam Khalifa Bashier Babiker and Mi-Young Kim and Randy Goebel},
journal= {arXiv preprint arXiv:2603.13326},
year = {2026}
}