像素中的幽默:评估大型多模态模型对在线漫画的理解
计算机视觉与模式识别
2025-09-18 v2 人工智能
计算与语言
摘要
理解幽默是社会智能的核心方面,但它对大型多模态模型 (LMMs) 仍然是一个重大挑战。我们引入了 PixelHumor,一个包含 2,800 个标注多格漫画的基准数据集,旨在评估 LMMs 解释多模态幽默和识别叙事序列的能力。对最先进的 LMMs 进行的实验揭示了巨大的差距:例如,顶级模型在画格排序中的准确率仅为 61%,远低于人类表现。这凸显了当前模型在整合视觉和文本线索以进行连贯叙事和幽默理解方面的关键局限性。通过提供一个评估多模态上下文和叙事推理的严格框架,PixelHumor 旨在推动 LMMs 的发展,使其更好地参与自然、具备社会意识的交互。
引用
@article{arxiv.2509.12248,
title = {Humor in Pixels: Benchmarking Large Multimodal Models Understanding of Online Comics},
author = {Yuriel Ryan and Rui Yang Tan and Kenny Tsu Wei Choo and Roy Ka-Wei Lee},
journal= {arXiv preprint arXiv:2509.12248},
year = {2025}
}
备注
27 pages, 8 figures, EMNLP 2025 Findings