用于多模态情感分析的增强型双 Transformer 对比网络
机器学习
2025-10-29 v1 人工智能
计算与语言
摘要
多模态情感分析(MSA)旨在通过联合分析来自多个模态(通常是文本和图像)的数据来理解人类情绪,这种方法比单模态方法更为精彩和准确。本文首先提出了 BERT-ViT-EF,这是一个新颖的模型,通过早期融合策略将基于 Transformer 的编码器 BERT 用于文本输入而 ViT 用于视觉输入。这种方法促进了更深入的跨模态交互和更有效的联合表征学习。为进一步增强模型的能力,我们提出了一种扩展方案,即双 Transformer 对比网络(DTCN),它基于 BERT-ViT-EF。DTCN 在 BERT 之后添加了一个 Transformer 编码器层,以在融合前细化文本语境,并采用对比学习来对齐文本和图像表征,以促进稳健的多模态特征学习。在两个广泛使用的 MSA 基准数据集 MVSA-Single 和 TumEmo 上进行的实验结果表明,我们的方法有效。DTCN 在 TumEmo 上实现了最高的准确率(78.4%)和 F1 分数(78.3%),在 MVSA-Single 上也表现出竞争力,准确率为 76.6%,F1 分数为 75.9%。这些改进凸显了基于 Transformer 的多模态情感分析中早期融合和更深层语境建模的优势。
引用
@article{arxiv.2510.23617,
title = {An Enhanced Dual Transformer Contrastive Network for Multimodal Sentiment Analysis},
author = {Phuong Q. Dao and Mark Roantree and Vuong M. Ngo},
journal= {arXiv preprint arXiv:2510.23617},
year = {2025}
}
备注
The paper has been accepted for presentation at the MEDES 2025 conference