EmoNet-Face:用于合成情感识别的专家标注基准
计算机视觉与模式识别
2025-05-28 v2 人工智能
摘要
有效的人机交互依赖于 AI 准确感知和解释人类情感的能力。当前的视觉和视觉-语言模型基准存在严重局限性,提供的情感谱较窄,忽略了细微状态(例如苦涩、醉酒),并且未能区分相关情感之间的细微差别(例如羞耻与尴尬)。现有数据集也通常使用带有遮挡面部且缺乏人口统计学多样性的不受控图像,存在显著偏差的风险。为了解决这些关键空白,我们引入了 EmoNet Face,一个全面的基准套件。EmoNet Face 的特点包括:(1) 一个新颖的 40 类情感分类体系,从基础研究中精心推导,以捕捉人类情感体验的更精细细节。(2) 三个大规模、AI 生成的数据集(EmoNet HQ、Binary 和 Big),具有明确的、全脸表情,并在种族、年龄和性别上保持受控的人口统计学平衡。(3) 用于训练和高保真评估的严格的多专家标注。(4) 我们构建了 EmpathicInsight-Face,一个在我们的基准上达到人类专家级性能的模型。公开发布的 EmoNet Face 套件——分类体系、数据集和模型——为开发和评估具有对人类情感更深层理解的 AI 系统提供了稳健的基础。
引用
@article{arxiv.2505.20033,
title = {EmoNet-Face: An Expert-Annotated Benchmark for Synthetic Emotion Recognition},
author = {Christoph Schuhmann and Robert Kaczmarczyk and Gollam Rabby and Felix Friedrich and Maurice Kraus and Krishna Kalyan and Kourosh Nadi and Huu Nguyen and Kristian Kersting and Sören Auer},
journal= {arXiv preprint arXiv:2505.20033},
year = {2025}
}