UniEmoX:面向通用场景情感感知的跨模态语义引导大规模预训练
人工智能
2025-07-21 v3 计算机视觉与模式识别
摘要
视觉情感分析在计算机视觉和心理学中均具有重要的研究价值。然而,由于情感感知的模糊性和数据场景的多样性,现有的视觉情感分析方法泛化能力有限。为了解决这个问题,我们引入了 UniEmoX,一个跨模态语义引导的大规模预训练框架。受强调情感探索过程与个体及其环境之间相互作用不可分割的心理学研究启发,UniEmoX 整合了以场景为中心和以人为中心的低级图像空间结构信息,旨在得出更细致且具判别性的情感表示。通过利用成对和不成对的图文样本之间的相似性,UniEmoX 从 CLIP 模型中蒸馏出丰富的语义知识,以更有效地增强情感嵌入表示。据我们所知,这是第一个将心理学理论与当代对比学习和掩蔽图像建模技术相结合,用于跨不同场景情感分析的大规模预训练框架。此外,我们开发了一个名为 Emo8 的视觉情感数据集。Emo8 的样本涵盖了多个领域,包括卡通、自然、写实、科幻和广告封面风格,覆盖了几乎所有常见的情感场景。在两个下游任务的六个基准数据集上进行的综合实验验证了 UniEmoX 的有效性。源代码可在 https://github.com/chincharles/u-emo 获取。
引用
@article{arxiv.2409.18877,
title = {UniEmoX: Cross-modal Semantic-Guided Large-Scale Pretraining for Universal Scene Emotion Perception},
author = {Chuang Chen and Xiao Sun and Zhi Liu},
journal= {arXiv preprint arXiv:2409.18877},
year = {2025}
}
备注
Accepted by IEEE TIP