从面板到叙事:从漫画生成文学叙事
计算机视觉与模式识别
2025-04-01 v1
摘要
漫画长期以来是一种流行的叙事形式,提供富有视觉吸引力的叙事,能够吸引全球观众。然而,漫画的视觉属性为视障读者带来了显著的障碍,限制了他们对这些引人入胜的故事的访问。本文通过开发一个自动化系统,从漫画( manga)生成基于文本的文学叙事,为解决这一可及性挑战提供了一种务实的解决方案。我们的 метод旨在创建引人入胜且沉浸式的叙事文本,不仅传达原始叙事,还捕捉角色、其互动以及其居住环境中鲜明环境的深度和复杂性。为此,我们作出以下贡献:(1) 我们提出了统一模型 Magiv3,在诸多涉及漫画理解的功能任务方面表现卓越,例如定位面板、角色、文本和 speech-bubble尾部、执行 OCR、对角色进行定位等。(2) 我们发布了超过 3300 幅日本漫画面板的人工标注标题,以及角色定位标注,并对大型视觉语言模型在理解漫画图像方面的能力进行基准测试。(3) 最终,我们展示了将大型视觉语言模型与 Magiv3 集成后,如何生成无缝的文学叙事,使视障听众能够参与漫画叙事的深度和丰富性。
引用
@article{arxiv.2503.23344,
title = {From Panels to Prose: Generating Literary Narratives from Comics},
author = {Ragav Sachdeva and Andrew Zisserman},
journal= {arXiv preprint arXiv:2503.23344},
year = {2025}
}