MemeArena:面向多模态大语言模型情景感知下无偏枢轴评估有害理解的自动化框架
计算与语言
2025-11-03 v1 人工智能
摘要
表情包在社交媒体上的激增,使得多模态大语言模型(mLLM)具备有效理解多模态有害性的能力成为必要。现有的评估方法主要聚焦于 mLLM 对二元分类任务的检测准确性,往往难以反映有害性在不同情景下所蕴含的深层解释细微差别。本文提出了 MemeArena,一个基于智能体的竞技场式评估框架,为 mLLM 的多模态有害性理解提供情景感知且无偏的评估。具体而言,MemeArena 模拟多样化的解释情景,以构建评估任务,从而引导 mLLM 提供特定视角的分析。通过整合多种视角并在评估者之间达成共识,实现对 mLLM 理解多模态有害性能力的公平且无偏的比较。大量实验表明,我们的框架有效降低了评判智能体的评估偏差,判决结果与人类偏好高度吻合,为在多模态有害性理解领域提供可靠且全面的 mLLM 评估提供了宝贵洞见。我们的代码和数据已公开于 https://github.com/Lbotirx/MemeArena。
引用
@article{arxiv.2510.27196,
title = {MemeArena: Automating Context-Aware Unbiased Evaluation of Harmfulness Understanding for Multimodal Large Language Models},
author = {Zixin Chen and Hongzhan Lin and Kaixin Li and Ziyang Luo and Yayue Deng and Jing Ma},
journal= {arXiv preprint arXiv:2510.27196},
year = {2025}
}
备注
EMNLP 2025