WisdoM:通过融合上下文世界知识改进多模态情感分析
计算与语言
2024-02-21 v2
摘要
情感分析通过利用各种数据模态(例如文本、图像)正在迅速发展。然而,大多数先前的工作依赖于表面信息,忽视了上下文世界知识(例如,源自给定图像和文本对但又超越其之外的背景信息)的整合,从而限制了它们实现更好的多模态情感分析 (MSA) 的能力。在本文中,我们提出了一个名为 WisdoM 的即插即用框架,以利用从大型视觉语言模型 (LVLMs) 中引出的上下文世界知识来增强 MSA。WisdoM 利用 LVLMs 综合分析图像和相应文本,同时生成相关的上下文。为了减少上下文中的噪声,我们还引入了一种无需训练的上下文融合机制。跨不同粒度的 MSA 任务的实验一致表明,我们的方法相比几种最先进的方法有显著改进(在五种先进方法中平均带来 +1.96% 的 F1 分数提升)。
引用
@article{arxiv.2401.06659,
title = {WisdoM: Improving Multimodal Sentiment Analysis by Fusing Contextual World Knowledge},
author = {Wenbin Wang and Liang Ding and Li Shen and Yong Luo and Han Hu and Dacheng Tao},
journal= {arXiv preprint arXiv:2401.06659},
year = {2024}
}