中文

MEMO-Bench:面向文本到图像和多模态大语言模型的人类情感分析多基准测试集

计算与语言 2024-11-19 v1 人工智能

摘要

人工智能(AI)在多个领域展现出显著能力,而在人机交互(HCI)、具身智能以及虚拟数字人的设计与动画等领域,从业者和用户都日益关注AI理解和表达情感的能力。因此,AI能否准确解读人类情感仍是一个关键挑战。迄今为止,涉及人类情感分析的AI模型主要有两类:生成模型和多模态大语言模型(MLLMs)。为评估这两类模型的情感能力,本研究引入了MEMO-Bench,这是一个综合基准测试集,包含由12个文本到图像(T2I)模型生成的7,145张人像,每张人像描绘六种不同情感之一。与以往工作不同,MEMO-Bench提供了一个在情感分析背景下同时评估T2I模型和MLLMs的框架。此外,我们采用了一种从粗粒度到细粒度的渐进式评估方法,以对MLLMs的情感分析能力提供更细致、更全面的评估。实验结果表明,现有的T2I模型在生成积极情感方面比生成消极情感更有效。同时,尽管MLLMs在区分和识别人类情感方面表现出一定程度的有效性,但其准确度尚未达到人类水平,尤其是在细粒度情感分析方面。MEMO-Bench将公开发布,以支持该领域的进一步研究。

关键词

引用

@article{arxiv.2411.11235,
  title  = {MEMO-Bench: A Multiple Benchmark for Text-to-Image and Multimodal Large Language Models on Human Emotion Analysis},
  author = {Yingjie Zhou and Zicheng Zhang and Jiezhang Cao and Jun Jia and Yanwei Jiang and Farong Wen and Xiaohong Liu and Xiongkuo Min and Guangtao Zhai},
  journal= {arXiv preprint arXiv:2411.11235},
  year   = {2024}
}