探索多模态方面基准情感分析中的认知与审美因果关系
计算与语言
2025-04-23 v1
摘要
多模态方面情感分类(MASC)是一项新兴任务,由于用户生成的多模态内容在社交平台上的增加,旨在预测针对特定方面目标(即在文本-图像对中明确提及的实体或属性)的情感极性。尽管在现有 MASC 领域已有大量努力和显著成就,但仍存在对细粒度视觉内容和从语义内容及印象(图像内容所唤起情感反应的认知解释)中派生的认知理由的理解之间的大量鸿沟。本研究提出 Chimera:一种认知与审美情感因果理解框架,用于从语义视角和情感-认知共振(情感反应与认知解释之间的协同效应)中推导方面的细粒度整体特征并推断情感表达的基本驱动因素。具体而言,该框架首先整合视觉块特征用于块-词对齐。同时,它提取粗粒度视觉特征(如整体图像表示)和细粒度视觉区域(如与方面相关的区域),并将其转换为相应的文本描述(如面部表情、审美特征)。最后,我们利用由大型语言模型(LLM)生成的情感原因和印象,以增强模型对由语义内容和情感-认知共振所唤起的情感线索的意识。实验结果表明,所提出的模型在标准 MASC 数据集上表现有效,该模型也比诸如 GPT-4o 等大型语言模型在 MASC 上的灵活性更大。我们已在 https://github.com/Xillv/Chimera 上公开完整实现和数据集。
引用
@article{arxiv.2504.15848,
title = {Exploring Cognitive and Aesthetic Causality for Multimodal Aspect-Based Sentiment Analysis},
author = {Luwei Xiao and Rui Mao and Shuai Zhao and Qika Lin and Yanhao Jia and Liang He and Erik Cambria},
journal= {arXiv preprint arXiv:2504.15848},
year = {2025}
}
备注
Accepted by TAFFC 2025