中文

MultiViz:面向多模态模型的可视化与理解

机器学习 2023-03-08 v3 人工智能 计算与语言 计算机视觉与模式识别 多媒体

摘要

多模态模型在现实应用中的前景激发了对其内部机制进行可视化与理解的研究,最终目标是使干系人能够可视化模型行为、执行模型调试并增进对机器学习模型的信任。然而,现代多模态模型通常是黑盒神经网络,这使其内部机制难以理解。我们如何可视化这些模型中多模态交互的内部建模?本文旨在通过提出 MultiViz 填补此空白,这是一种通过将可解释性问题构建为 4 个阶段来分析多模态模型行为的方法:(1)单模态重要性:各模态如何贡献于下游建模与预测;(2)跨模态交互:不同模态如何相互关联;(3)多模态表征:单模态与跨模态交互如何在决策级特征中表示;(4)多模态预测:决策级特征如何组合以做出预测。MultiViz 设计用于适配多样模态、模型、任务与研究领域的。通过对 6 个真实任务上 8 个训练模型的实验,我们表明 MultiViz 中互补的各阶段共同使用户能够(1)模拟模型预测,(2)为特征赋予可解释概念,(3)对模型误分类进行错误分析,以及(4)利用错误分析中的洞见调试模型。MultiViz 已公开可用,将定期更新新的解释工具与指标,并欢迎社区输入。

关键词

引用

@article{arxiv.2207.00056,
  title  = {MultiViz: Towards Visualizing and Understanding Multimodal Models},
  author = {Paul Pu Liang and Yiwei Lyu and Gunjan Chhablani and Nihal Jain and Zihao Deng and Xingbo Wang and Louis-Philippe Morency and Ruslan Salakhutdinov},
  journal= {arXiv preprint arXiv:2207.00056},
  year   = {2023}
}

备注

ICLR 2023. Code available at: https://github.com/pliang279/MultiViz