视觉与语言中缺失的一环:漫画理解综述
计算机视觉与模式识别
2025-01-09 v2
摘要
视觉-语言模型近来已发展为多功能系统,能够在文档理解、视觉问答和基础定位等任务中表现出高性能,且通常支持零样本设置。漫画理解作为一个复杂且多方面的领域,有望从这些进展中极大受益。漫画作为一种媒介,结合了丰富的视觉和文本叙事,通过序列化分格,在图像分类、目标检测、实例分割以及更深层的叙事理解等任务上挑战AI模型。然而,漫画的独特结构——以风格、阅读顺序和非线性叙事的创造性变化为特征——带来了一系列不同于其他视觉-语言领域的挑战。在本综述中,我们从数据集和任务两个角度对漫画理解进行了全面回顾。我们的贡献有五点:(1)分析了漫画媒介的结构,详述其独特的构成元素;(2)调研了漫画研究中广泛使用的数据集和任务,强调其在推动领域发展中的作用;(3)引入了漫画理解层级(LoCU)框架,这是一种重新定义漫画中视觉-语言任务的新分类法,为未来工作奠定基础;(4)依据LoCU框架对现有方法进行了详细回顾和分类;(5)最后,我们指出了当前的研究挑战,并提出了未来探索方向,特别是针对应用于漫画的视觉-语言模型。本综述首次提出了面向漫画智能的任务导向框架,旨在通过解决数据可用性和任务定义方面的关键空白来指导未来研究。与本综述相关的项目可在 https://github.com/emanuelevivoli/awesome-comics-understanding 获取。
关键词
引用
@article{arxiv.2409.09502,
title = {One missing piece in Vision and Language: A Survey on Comics Understanding},
author = {Emanuele Vivoli and Mohamed Ali Souibgui and Andrey Barsky and Artemis LLabrés and Marco Bertini and Dimosthenis Karatzas},
journal= {arXiv preprint arXiv:2409.09502},
year = {2025}
}
备注
under review. project website: https://github.com/emanuelevivoli/awesome-comics-understanding