中文

用于漫画文本完形填空的多模态 Transformer

计算机视觉与模式识别 2024-03-07 v1

摘要

本研究探索了漫画中的一种完形填空任务,漫画是一种视觉与文本元素紧密交织的媒介。具体而言,文本完形填空(Text-cloze)是指在给定相邻分镜的情况下,为漫画分镜选择正确文本的任务。基于循环神经网络的传统方法由于 OCR 准确率有限及模型固有的局限性,在此任务上表现不佳。我们提出了一种专为文本完形填空设计的新型多模态大语言模型(Multimodal-LLM)架构,在其简单和困难变体上均比现有最先进(SOTA)模型提升了 10%。我们方法的核心是一个基于 Domain-Adapted ResNet-50 的视觉编码器,该编码器利用 SimCLR 以自监督方式针对漫画领域进行了微调。该编码器仅用复杂模型五分之一的参数量即可交付相当的结果。此外,我们发布了该数据集的新 OCR 标注,提升了模型输入质量,从而带来了额外的 1% 性能提升。最后,我们将该任务扩展至生成式格式,建立了新的基线,并拓展了漫画分析领域的研究可能性。

关键词

引用

@article{arxiv.2403.03719,
  title  = {Multimodal Transformer for Comics Text-Cloze},
  author = {Emanuele Vivoli and Joan Lafuente Baeza and Ernest Valveny Llobet and Dimosthenis Karatzas},
  journal= {arXiv preprint arXiv:2403.03719},
  year   = {2024}
}