MangaUB:面向大型多模态模型的漫画理解基准
计算机视觉与模式识别
2024-10-23 v1 多媒体
摘要
漫画是一种结合特色绘画和文本以传递故事的流行媒介。由于漫画面板不同于自然图像,计算系统传统上必须专为漫画设计。最近,现代大型多模态模型 (LMM) 的自适应性表明了更通用方法的可能性。为分析当前 LMM 在漫画理解任务中的能力并确定其改进的领域,我们设计并评估了 MangaUB,一种 novel 漫画理解基准。MangaUB 旨在评估模型对单个面板所显示内容的识别与理解,以及跨多个面板所传递信息的理解,允许对模型在漫画理解中所需的各种能力进行细粒度分析。我们的结果显示,在图像内容识别方面表现突出,而对理解跨多个面板所传递的情绪和信息仍具有挑战性,这凸显了面向漫画理解的 LMM 的未来工作方向。
引用
@article{arxiv.2407.19034,
title = {MangaUB: A Manga Understanding Benchmark for Large Multimodal Models},
author = {Hikaru Ikuta and Leslie Wöhler and Kiyoharu Aizawa},
journal= {arXiv preprint arXiv:2407.19034},
year = {2024}
}
备注
This work has been submitted to the IEEE for possible publication