ComiCap:用于漫画面板密集描述的VLMs流水线
计算机视觉与模式识别
2024-09-25 v1
摘要
随着单页和多页分析与合成模型的发展,漫画领域正在迅速进步。近期引入的基准测试和数据集旨在支持和评估模型在检测(面板、角色、文本)、链接(角色重识别和说话人识别)以及漫画元素分析(如对话转录)等任务中的能力。然而,为了全面理解故事情节,模型不仅需要提取元素,还需要理解它们之间的关系并生成信息量极高的描述。在这项工作中,我们提出了一种利用视觉语言模型(VLMs)来获取密集且有依据的描述的流水线。为了构建我们的流水线,我们引入了一种属性保留指标,用于评估描述中是否识别了所有重要属性。此外,我们创建了一个密集标注的测试集,以公平地评估开源VLMs,并根据我们的指标选择最佳的描述模型。我们的流水线生成的带有边界框的密集描述在定量和定性上均优于专门训练的模型所生成的结果,且无需任何额外训练。使用该流水线,我们标注了13,000本书中的超过200万个面板,这些数据将在项目页面 https://github.com/emanuelevivoli/ComiCap 上提供。
引用
@article{arxiv.2409.16159,
title = {ComiCap: A VLMs pipeline for dense captioning of Comic Panels},
author = {Emanuele Vivoli and Niccolò Biondi and Marco Bertini and Dimosthenis Karatzas},
journal= {arXiv preprint arXiv:2409.16159},
year = {2024}
}
备注
Accepted at ECCV 2024 Workshop (AI for Visual Art), repo: https://github.com/emanuelevivoli/ComiCap