M2C:迈向自动多模态漫画补全
计算与语言
2023-10-27 v1
摘要
多模态漫画分析致力于利用视觉与文本特征增强漫画理解,已引起自然语言处理与计算机视觉领域的广泛关注。当前多数漫画为手绘,易出现缺页、文字污染、老化等问题,导致漫画文本内容缺失,严重阻碍人类理解。换言之,旨在通过上述问题的处理为视觉与语言理解提供共享语义空间的“多模态漫画补全(Multimodal Manga Complement, M2C)”任务尚未被研究。为此,我们首先通过建立覆盖两种语言的新 M2C 基准数据集,提出了多模态漫画补全任务。首先,我们设计了一种称为 MCoT 的漫画论证方法,利用大语言模型挖掘漫画中的事件知识。随后,提出了一种使用细粒度视觉提示的有效基线 FVP-M 以支持漫画补全。大量实验结果表明 FVP-M 方法在多模态漫画补全上的有效性。
引用
@article{arxiv.2310.17130,
title = {M2C: Towards Automatic Multimodal Manga Complement},
author = {Hongcheng Guo and Boyang Wang and Jiaqi Bai and Jiaheng Liu and Jian Yang and Zhoujun Li},
journal= {arXiv preprint arXiv:2310.17130},
year = {2023}
}
备注
EMNLP2023. arXiv admin note: text overlap with arXiv:2210.15461