中文

CoMix:多任务漫画理解综合基准

计算机视觉与模式识别 2024-11-01 v2

摘要

漫画领域正快速发展,单页分析和合成模型层出不穷。然而,评估指标和数据集落后于人们的需求,往往仅限于小规模或单一风格的测试集。我们引入了新的基准 CoMix,旨在评估模型在漫画分析中多任务能力。与现有仅聚焦于单一任务(如目标检测或文本识别)的基准不同,CoMix 覆盖更广泛的任务,包括目标检测、说话人识别、人物重识别、阅读顺序以及此类人物命名和对话生成等多模态推理任务。我们的基准包含三个现有数据集,并扩展了注释以支持多任务评估。为缓解 manga 风格数据过度代表的问题,我们引入了来自美国漫画书籍的新数据集,从而丰富了漫画风格的多样性。CoMix 旨在评估在零样迁移和有限微调设置下的预训练模型,探索其在不同漫画风格和任务上的迁移能力。基准的验证分割已公开供研究使用,测试分割的评估服务器也已提供。与人类性能和最新模型的比较结果显示,性能之间存在显著差距,凸显了漫画理解领域仍有广阔的提升空间。数据集、基线模型和代码均可在 https://github.com/emanuelevivoli/CoMix-dataset 获取。该倡议为漫画分析设定了新的标准,为社区提供了大规模且多样化任务集合的通用评估基准。

关键词

引用

@article{arxiv.2407.03550,
  title  = {CoMix: A Comprehensive Benchmark for Multi-Task Comic Understanding},
  author = {Emanuele Vivoli and Marco Bertini and Dimosthenis Karatzas},
  journal= {arXiv preprint arXiv:2407.03550},
  year   = {2024}
}

备注

Accepted at NeurIPS 2024 (D&B)