中文

通过多模态融合增强情感分析:一种 BERT-DINOv2 方法

计算机视觉与模式识别 2025-03-12 v1 计算与语言

摘要

多模态情感分析通过整合来自图像、文本和音频等不同模态的信息,增强了传统上仅依赖文本的情感分析。本文提出了一种新颖的多模态情感分析架构,该架构融合文本与图像数据,以提供对情感更全面的理解。对于文本特征提取,我们利用了自然语言处理模型 BERT。对于图像特征提取,我们采用了基于 vision-transformer 的模型 DINOv2。文本与视觉的潜在特征通过所提出的融合技术进行整合,即基础融合模型、自注意力融合模型和双注意力融合模型。在三个数据集(Memotion 7k 数据集、MVSA single 数据集和 MVSA multi 数据集)上的实验,证明了所提出的多模态架构的可行性与实用性。

关键词

引用

@article{arxiv.2503.07943,
  title  = {Enhancing Sentiment Analysis through Multimodal Fusion: A BERT-DINOv2 Approach},
  author = {Taoxu Zhao and Meisi Li and Kehao Chen and Liye Wang and Xucheng Zhou and Kunal Chaturvedi and Mukesh Prasad and Ali Anaissi and Ali Braytee},
  journal= {arXiv preprint arXiv:2503.07943},
  year   = {2025}
}

备注

12 pages