MMAFFBen:一个用于评估 LLMs 和 VLMs 的多语言多模态情感分析基准
计算与语言
2025-06-02 v1
摘要
大语言模型和视觉语言模型(我们统称为语言模型,LMs)已经变革了自然语言处理(NLP)和计算机视觉(CV),在各个领域展现出非凡的潜力。然而,它们在情感分析(即情感倾向分析和情绪检测)方面的能力仍未被充分探索。这一差距主要归因于缺乏全面的评估基准,以及情感分析任务固有的复杂性。在本文中,我们引入了 MMAFFBen,这是第一个用于多语言多模态情感分析的大型开源基准。MMAFFBen 涵盖了 35 种语言的文本、图像和视频模态,包含四项关键情感分析任务:情感极性、情感强度、情绪分类和情绪强度。此外,我们构建了 MMAFFIn 数据集用于在情感分析任务上微调 LMs,并在此基础上进一步开发了 MMAFFLM-3b 和 MMAFFLM-7b。我们评估了包括 GPT-4o-mini 在内的多种代表性 LMs,对其情感理解能力进行了系统性比较。该项目可在 https://github.com/lzw108/MMAFFBen 获取。
引用
@article{arxiv.2505.24423,
title = {MMAFFBen: A Multilingual and Multimodal Affective Analysis Benchmark for Evaluating LLMs and VLMs},
author = {Zhiwei Liu and Lingfei Qian and Qianqian Xie and Jimin Huang and Kailai Yang and Sophia Ananiadou},
journal= {arXiv preprint arXiv:2505.24423},
year = {2025}
}
备注
Work in progress