通过多模态融合建模认知评估预测中的诱导愉悦
人工智能
2026-04-28 v1 人机交互
机器学习
摘要
多模态情感计算分析用户生成的社交媒体内容以预测情绪状态。然而,仍存在一个关键性 gap:即视觉内容如何塑造认知解释并诱发特定情感体验(如愉悦)。本研究引入一种新型计算模型,以推断视频诱导的愉悦。该模型针对四个挑战问题进行设计:(1)噪声且不一致的人类标签;(2)“积极情绪”与“愉悦”之间的语义鸿沟;(3)愉悦特定数据集的稀缺;(4)现有黑箱融合方法的可解释性有限。我们的方案集成数据驱动方法与认知理论驱动方法,运用认知评估理论和模糊模型构建于创新框架内。该模型采用基于Transformer的架构和注意力机制进行细粒度多模态特征提取和可解释融合,以捕捉与愉悦相关的跨模态和内模态动态。通过预测底层评估变量,桥接语义鸿沟,并超越传统统计关联提升模型可解释性。实验结果验证了所提方法在检测视频诱导愉悦方面的有效性,实现愉悦水平预测的最高准确率为0.6624。这些发现凸显了情感内容推荐、智能媒体创建,以及数字媒体如何影响人类情绪的理解方面的前景意义。
引用
@article{arxiv.2604.23753,
title = {Modeling Induced Pleasure through Cognitive Appraisal Prediction via Multimodal Fusion},
author = {Nastaran Dab and Raziyeh Zall and Mohammadreza Kangavari},
journal= {arXiv preprint arXiv:2604.23753},
year = {2026}
}