中文

MangaVQA 与 MangaLMM:面向多模态漫画理解的基准与专用模型

计算与语言 2026-01-27 v3 人工智能 计算机视觉与模式识别

摘要

漫画,即日本漫画,是一种丰富的多模态叙事形式,以复杂的方式融合了图像和文本。教会大型多模态模型(LMM)以人类水平理解此类叙事,可以帮助漫画创作者反思和完善他们的故事。为此,我们引入了两个用于多模态漫画理解的基准:MangaOCR,针对页面内文本识别;以及 MangaVQA,一种旨在通过视觉问答评估上下文理解的新型基准。MangaVQA 包含 526 个高质量、人工构建的问答对,能够在多样的叙事和视觉场景中进行可靠评估。在此基准之上,我们开发了 MangaLMM,这是一个从开源 LMM Qwen2.5-VL 微调而来的漫画专用模型,可同时处理这两项任务。通过广泛的实验,包括与 GPT-4o 和 Gemini 2.5 等专有模型的比较,我们评估了 LMM 理解漫画的能力。我们的基准和模型为在丰富的漫画叙事领域评估和推进 LMM 提供了全面的基础。

关键词

引用

@article{arxiv.2505.20298,
  title  = {MangaVQA and MangaLMM: A Benchmark and Specialized Model for Multimodal Manga Understanding},
  author = {Jeonghun Baek and Kazuki Egashira and Shota Onohara and Atsuyuki Miyai and Yuki Imajuku and Hikaru Ikuta and Kiyoharu Aizawa},
  journal= {arXiv preprint arXiv:2505.20298},
  year   = {2026}
}

备注

EACL 2026 Findings. Project page: https://manga109.github.io/MangaVQA_LMM/