我的多模态模型学到跨模态交互了吗?这比你想象的更难判断!
计算与语言
2020-10-14 v1 计算机视觉与模式识别
摘要
在视觉问答等多模态任务中,建模富有表现力的跨模态交互似乎至关重要。然而,有时高性能的黑盒算法最终主要利用的是数据中的单模态信号。我们提出了一种新的诊断工具——经验多模态可加函数投影(EMAP),用于分离给定模型在给定任务上性能的提升是否源于跨模态交互。该函数投影修改模型预测,从而消除跨模态交互,分离出可加的单模态结构。对于七个图像+文本分类任务(我们在每个任务上都刷新了当前最优基准),我们发现,在许多情况下,移除跨模态交互导致的性能下降微乎其微甚至没有。令人惊讶的是,即便那些具有考虑交互能力的富有表现力的模型在其他情况下优于表现力较弱的模型,这一结论依然成立;因此,即便存在性能提升,往往也不能归因于对跨模态特征交互的考虑。为此,我们建议多模态机器学习的研究者在报告结果时,不仅应给出单模态基线的性能,还应给出其最佳性能模型的 EMAP。
引用
@article{arxiv.2010.06572,
title = {Does my multimodal model learn cross-modal interactions? It's harder to tell than you might think!},
author = {Jack Hessel and Lillian Lee},
journal= {arXiv preprint arXiv:2010.06572},
year = {2020}
}