基于分布恢复与融合的图像-文本对鲁棒多模态情感分析
计算与语言
2025-12-04 v3
摘要
随着社交媒体帖子的快速增长,分析嵌入在图像-文本对中的情感已成为近年来热门的研究主题。尽管现有工作在同时利用图像和文本信息方面取得了令人印象深刻的成就,但它们缺乏对可能的低质量和缺失模态的考虑。在实际应用中,这些问题可能频繁发生,导致迫切需要能够对情感鲁棒预测的模型。因此,我们提出了一种基于分布恢复与融合(DRF)方法,用于图像-文本对的鲁棒多模态情感分析。具体而言,我们为每种模态维护一个特征队列,以近似其特征分布,从而在统一的框架中同时处理低质量和缺失模态。对于低质量模态,我们通过基于分布的定量估计模态质量来降低其在融合中的贡献。对于缺失模态,我们构建由样本和分布监督的跨模态映射关系,从而从可用模态中恢复缺失模态。在实验中,我们采用两种扰乱策略破坏和丢弃部分模态,以模拟各种实际场景中的低质量和缺失模态情况。在三个公开可用的图像-文本数据集上进行全面实验,表明 DRF 在两种策略下均相较于 SOTA 方法实现了普遍性改进,验证了其在鲁棒多模态情感分析中的有效性。
引用
@article{arxiv.2511.18751,
title = {Robust Multimodal Sentiment Analysis of Image-Text Pairs by Distribution-Based Feature Recovery and Fusion},
author = {Daiqing Wu and Dongbao Yang and Yu Zhou and Can Ma},
journal= {arXiv preprint arXiv:2511.18751},
year = {2025}
}
备注
Accepted by ACM MM 2024