中文

漫画数据集框架:用于检测基准的漫画数据集混合

计算机视觉与模式识别 2024-07-08 v1

摘要

漫画作为一种媒介,独特地将文本与图像组合在常与真实世界视觉风格不同的风格中。三十年来,计算漫画研究从基本对象检测发展到更精细的任务。然而,该领域面临持续的挑战,如数据集小、注释不一致、模型权重不可访问,且由于不同的训练/测试划分和指标,结果无法直接比较。为此,我们旨在标准化跨数据集的注释,引入多样化的漫画风格,并以清晰、可复制的设置建立基准结果。我们提出的漫画数据集框架将数据集注释标准化为通用格式,并通过引入 Comics100——这是一个来自 Digital Comics Museum 的 100 本精选书籍,为检测在我们的统一格式中进行注释——来解决 manga 被过度代表的问题。我们使用漫画数据集框架对各种检测架构进行基准测试。所有相关代码、模型权重和详细的评估过程均可在 https://github.com/emanuelevivoli/cdf 获取,确保透明度并促进复制。这一倡议是提高漫画中对象检测的重要进展,为依赖精确对象识别的更复杂计算任务奠定了基础。

关键词

引用

@article{arxiv.2407.03540,
  title  = {Comics Datasets Framework: Mix of Comics datasets for detection benchmarking},
  author = {Emanuele Vivoli and Irene Campaioli and Mariateresa Nardoni and Niccolò Biondi and Marco Bertini and Dimosthenis Karatzas},
  journal= {arXiv preprint arXiv:2407.03540},
  year   = {2024}
}

备注

Accepted at MANPU - COMICS workshop at ICDAR