MER-Bench:用于多模态 meme 再评估的综合基准
计算机视觉与模式识别
2026-03-17 v1 计算与语言
摘要
Meme 是一种紧密耦合的多模态社会表达形式,其中视觉上下文和叠加文本共同传递细腻的情感与评论。灵感来自心理学中的认知重新评估,我们引入 Meme 再评估,这是一种新的多模态生成任务,旨在将以负面表述的 meme 转换为积极表述的 meme,同时保持其 underlying scenario、实体和结构布局。与 prior 在 meme 理解或生成方面的工作不同,Meme 再评估需要在多种语义和风格约束下实现情感可控、结构保持的多模态转换。为支持该任务,我们构建 MER-Bench,一个包含真实世界 meme 的基准,具有细粒度的多模态注释,包括源情感和目标情感、积极重写的 meme 文本、视觉编辑规格以及覆盖视觉类型、情感极性和布局结构的分类标签。我们进一步提出一种基于多模态大语言模型(MLLM)作为评判者的结构化评估框架,将性能分解为模态级生成质量、情感可控性、结构保真性和全局情感一致性。广泛的实验表明,在代表性图像编辑和多模态生成系统上,存在显著的不足,无法满足结构保持、语义一致性和情感转换的约束。我们认为 MER-Bench 为 controllable meme 编辑和情感感知多模态生成奠定了基础。我们的代码可在 https://github.com/one-seven17/MER-Bench 获取。
引用
@article{arxiv.2603.15020,
title = {MER-Bench: A Comprehensive Benchmark for Multimodal Meme Reappraisal},
author = {Yiqi Nie and Fei Wang and Junjie Chen and Kun Li and Yudi Cai and Dan Guo and Chenglong Li and Meng Wang},
journal= {arXiv preprint arXiv:2603.15020},
year = {2026}
}