AdamMeme: 适应性探测多模态大语言模型有害性推理能力
计算与语言
2025-07-03 v1 人工智能
摘要
社交媒体时代多模态表情包的不断涌现,要求多模态大语言模型 (mLLM) 有效理解表情包的有害性。现有评估 mLLM 在有害表情包理解方面能力的基准,依赖于基于准确率的、模型无关的评估,使用静态数据集。这些基准在提供及时且全面评估方面受限,因为在线表情包动态演变。为此,我们提出 AdamMeme,一种灵活的基于智能体的评估框架,用于适应性探测 mLLM 在解读表情包有害性方面的推理能力。通过多智能体协作,AdamMeme 通过迭代更新具有挑战性样本的表情包数据,提供全面评估,从而暴露 mLLM 解释有害性的特定局限性。大量实验表明,该框架系统性地揭示了不同目标 mLLM 的不同性能,提供对模型特定弱点的深入、细粒度分析。我们的代码已公开于 https://github.com/Lbotirx/AdamMeme。
引用
@article{arxiv.2507.01702,
title = {AdamMeme: Adaptively Probe the Reasoning Capacity of Multimodal Large Language Models on Harmfulness},
author = {Zixin Chen and Hongzhan Lin and Kaixin Li and Ziyang Luo and Zhen Ye and Guang Chen and Zhiyong Huang and Jing Ma},
journal= {arXiv preprint arXiv:2507.01702},
year = {2025}
}
备注
ACL 2025