中文

从大规模语义丰富标题学习可迁移的人脸情感表示

计算机视觉与模式识别 2025-07-29 v1

摘要

当前的人脸情感识别系统主要训练于预测固定的预定义类别或抽象维度值。这种受限形式的监督方式限制了泛化能力和适用性,使情感的丰富且细致的光谱被简化为过度简化的标签或尺度。相比之下,自然语言提供了更灵活、更具表达力和可解释性的方式来表示情感,来源更广泛。然而,利用语义丰富的自然语言标题作为情感表示学习的监督信号仍相对不被探索,主要due to两个关键挑战:1)缺乏拥有丰富情感语义的大规模标题数据集,2)缺乏针对此类丰富监督的有效框架。为此,我们引入了 EmoCap100K,一个拥有超过 10 万样本的人脸情感标题数据集,特色是捕捉全局情感状态和细粒度局部面部行为的丰富且结构化的语义描述。基于该数据集,我们进一步提出了 EmoCapCLIP,该方法引入了由跨模态引导的正样本挖掘模块增强的联合全局-局部对比学习框架。该设计促进了多层次标题信息的全面利用,同时容纳 closely related expressions 之间的语义相似性。在覆盖五个任务的 20 多个基准上的大量评估表明,我们的方法在性能上具有优势,凸显了从大规模语义丰富标题中学习人脸情感表示的潜力。代码和数据将在 https://github.com/sunlicai/EmoCapCLIP 提供。

关键词

引用

@article{arxiv.2507.21015,
  title  = {Learning Transferable Facial Emotion Representations from Large-Scale Semantically Rich Captions},
  author = {Licai Sun and Xingxun Jiang and Haoyu Chen and Yante Li and Zheng Lian and Biu Liu and Yuan Zong and Wenming Zheng and Jukka M. Leppänen and Guoying Zhao},
  journal= {arXiv preprint arXiv:2507.21015},
  year   = {2025}
}