中文

EmotionHallucer:评估多模态大语言模型中的情感幻觉

计算机视觉与模式识别 2025-05-19 v1 计算与语言

摘要

情感理解是一项关键但具有挑战性的任务。多模态大语言模型(MLLM)的最新进展显著增强了其在该领域的能力。然而,MLLM经常遭受幻觉困扰,生成不相关或无意义的内容。据我们所知,尽管这一问题很重要,但尚未有专门的工作来评估MLLM中与情感相关的幻觉。在这项工作中,我们引入了EmotionHallucer,这是首个用于检测和分析MLLM中情感幻觉的基准。与人类的情感理解源于生物学和社会学习的相互作用不同,MLLM仅依赖数据驱动学习,缺乏先天的情感本能。幸运的是,情感心理学为人类情感提供了坚实的知识基础。基于此,我们从两个维度评估情感幻觉:情感心理学知识和真实世界的多模态感知。为了支持稳健的评估,我们采用了一个对抗性二元问答(QA)框架,该框架使用精心构建的基本对和幻觉对来评估MLLM的情感幻觉倾向。通过在EmotionHallucer上评估38个LLM和MLLM,我们发现:i)大多数当前模型在情感幻觉方面存在严重问题;ii)闭源模型在检测情感幻觉方面优于开源模型,且推理能力提供了额外优势;iii)现有模型在情感心理学知识方面的表现优于在多模态情感感知方面的表现。作为副产品,这些发现启发我们提出了PEP-MEK框架,该框架在所选模型的情感幻觉检测中平均提升了9.90%。相关资源将在https://github.com/xxtars/EmotionHallucer上提供。

关键词

引用

@article{arxiv.2505.11405,
  title  = {EmotionHallucer: Evaluating Emotion Hallucinations in Multimodal Large Language Models},
  author = {Bohao Xing and Xin Liu and Guoying Zhao and Chengyu Liu and Xiaolan Fu and Heikki Kälviäinen},
  journal= {arXiv preprint arXiv:2505.11405},
  year   = {2025}
}