中文

ComicsPAP:通过选取正确的画面理解漫画条带

计算机视觉与模式识别 2025-10-02 v3

摘要

大型多模态模型 (LMM) 在图像描述、VQA 和视频理解方面取得了显著进展,但仍然难以把握漫画中所蕴含的复杂时空线索。为此,我们提出了 ComicsPAP,这是一个专为漫画条带理解而设计的大规模基准数据集。该数据集包含超过 10 万个样本,组织为 5 个子任务,基于“选画面”框架,要求模型识别序列中缺失的画面。我们的评估在多图像和单图像协议下进行,结果显示当前最先进的 LMM 在这些任务上的表现接近随机水平,这凸显了其在捕捉时序和语境依赖方面的显著局限。为弥合这一差距,我们针对漫画条带的理解对 LMM 进行了适配,虽然模型规模只有 10 倍,但取得了更好的 ComicsPAP 结果,这表明 ComicsPAP 是推动多模态漫画理解未来研究的稳健资源。

关键词

引用

@article{arxiv.2503.08561,
  title  = {ComicsPAP: understanding comic strips by picking the correct panel},
  author = {Emanuele Vivoli and Artemis Llabrés and Mohamed Ali Souibgui and Marco Bertini and Ernest Valveny Llobet and Dimosthenis Karatzas},
  journal= {arXiv preprint arXiv:2503.08561},
  year   = {2025}
}