中文

M2Lens:面向情感分析的多模态模型可视化与解释系统

机器学习 2022-02-23 v4 计算与语言 人机交互 多媒体

摘要

多模态情感分析旨在从文本、语音和面部表情等多种沟通渠道识别人们的态度,已成为自然语言处理中一个充满活力且重要的研究方向。许多研究聚焦于建模不同沟通渠道间复杂的模态内与模态间交互。然而,当前性能强劲的多模态模型通常基于深度学习技术,且如同黑箱一般工作,模型如何利用多模态信息进行情感预测尚不清楚。尽管近期在增强机器学习模型可解释性方面取得进展,但这些技术往往针对单模态场景(如图像、句子),对多模态模型解释的研究甚少。本文提出一个交互式可视分析系统 M2Lens,用于可视化并解释情感分析的多模态模型。M2Lens 在全局、子集和局部层面对模态内与模态间交互提供解释,具体总结了三类典型交互类型(即主导、互补与冲突)对模型预测的影响;此外,M2Lens 识别频繁且具影响力的多模态特征,并支持从语言、声学与视觉模态对模型行为进行多面探索。通过两个案例研究与专家访谈,我们展示了该系统可帮助用户深入理解情感分析的多模态模型。

关键词

引用

@article{arxiv.2107.08264,
  title  = {M2Lens: Visualizing and Explaining Multimodal Models for Sentiment Analysis},
  author = {Xingbo Wang and Jianben He and Zhihua Jin and Muqiao Yang and Yong Wang and Huamin Qu},
  journal= {arXiv preprint arXiv:2107.08264},
  year   = {2022}
}

备注

11 pages, 7 figures. This paper is accepted by IEEE VIS, 2021. To appear in IEEE Transactions on Visualization and Computer Graphics (TVCG)