从言语与非言语交流中学习情感表示
计算机视觉与模式识别
2023-05-24 v1
摘要
情感理解是通用人工智能中至关重要却极具挑战的组成部分。大规模标注数据集的缺失严重阻碍了该领域的进展。我们提出 EmotionCLIP,这是首个仅利用未筛选数据从言语与非言语交流中提取视觉情感表示的预训练范式。相较于以往方法使用的数值标签或描述,交流天然包含情感信息。此外,从交流中获取情感表示更符合人类学习过程。我们通过主体感知上下文编码引导 EmotionCLIP 关注非言语情感线索,并利用情感引导的对比学习捕捉言语情感线索。大量实验验证了 EmotionCLIP 的有效性与可迁移性。仅采用线性探测评估协议,EmotionCLIP 便在多项基准上优于当前最优的有监督视觉情感识别方法,并与许多多模态方法相媲美。我们期望 EmotionCLIP 的问世能解决情感理解中普遍的数据稀缺问题,从而推动相关领域发展。代码与预训练模型见 https://github.com/Xeaver/EmotionCLIP。
引用
@article{arxiv.2305.13500,
title = {Learning Emotion Representations from Verbal and Nonverbal Communication},
author = {Sitao Zhang and Yimu Pan and James Z. Wang},
journal= {arXiv preprint arXiv:2305.13500},
year = {2023}
}
备注
CVPR 2023