漫画数据集框架:用于检测基准的漫画数据集混合
计算机视觉与模式识别
2024-07-08 v1
摘要
漫画作为一种媒介,独特地将文本与图像组合在常与真实世界视觉风格不同的风格中。三十年来,计算漫画研究从基本对象检测发展到更精细的任务。然而,该领域面临持续的挑战,如数据集小、注释不一致、模型权重不可访问,且由于不同的训练/测试划分和指标,结果无法直接比较。为此,我们旨在标准化跨数据集的注释,引入多样化的漫画风格,并以清晰、可复制的设置建立基准结果。我们提出的漫画数据集框架将数据集注释标准化为通用格式,并通过引入 Comics100——这是一个来自 Digital Comics Museum 的 100 本精选书籍,为检测在我们的统一格式中进行注释——来解决 manga 被过度代表的问题。我们使用漫画数据集框架对各种检测架构进行基准测试。所有相关代码、模型权重和详细的评估过程均可在 https://github.com/emanuelevivoli/cdf 获取,确保透明度并促进复制。这一倡议是提高漫画中对象检测的重要进展,为依赖精确对象识别的更复杂计算任务奠定了基础。
引用
@article{arxiv.2407.03540,
title = {Comics Datasets Framework: Mix of Comics datasets for detection benchmarking},
author = {Emanuele Vivoli and Irene Campaioli and Mariateresa Nardoni and Niccolò Biondi and Marco Bertini and Dimosthenis Karatzas},
journal= {arXiv preprint arXiv:2407.03540},
year = {2024}
}
备注
Accepted at MANPU - COMICS workshop at ICDAR