中文

EEmo-Logic:用于全面图像触发情感评估的统一数据集和多阶段框架

计算机视觉与模式识别 2026-05-26 v2

摘要

理解图像触发情感的多维属性和强度细微差异,对于推动机器共情能力及应用于多样化的人机交互应用至关重要。然而,现有模型仍受限于粗粒度情感感知或不足的推理能力。为弥合这一差距,我们引入了\textbf{EEmoDB}——迄今为止规模最大的图像-{\ul e}vtivated {\ul emo}tion understanding {\ul d}ataset(图像触发情感理解数据集)。其包含5个分析维度,覆盖5个 distinct task 类别,促进全面解释。具体而言,我们通过自动生成方式从125K张图像中编译了120万个问答(QA)对(EEmoDB-QA),同时从2.5万张图像中精选构建了3.6万数据集(EEmoDB-Assess)用于细粒度评估。进一步,我们提出了\textbf{EEmo-Logic}——一个\textbf{一体化}的多模态大语言模型(MLLM),通过指令微调和任务定制化的相对偏好优化(GRPO)实现,包含新颖的奖励设计。广泛实验表明,EEmo-Logic 在域内和跨域数据集上均表现稳健,尤其在情感问答和细粒度评估方面表现卓越。该数据集和代码已公开于 https://github.com/workerred/EEmo-Logic。

关键词

引用

@article{arxiv.2602.01173,
  title  = {EEmo-Logic: A Unified Dataset and Multi-Stage Framework for Comprehensive Image-Evoked Emotion Assessment},
  author = {Lancheng Gao and Ziheng Jia and Zixuan Xing and Wei Sun and Huiyu Duan and Guangtao Zhai and Xiongkuo Min},
  journal= {arXiv preprint arXiv:2602.01173},
  year   = {2026}
}