Re:Verse——你的视觉语言模型能读懂漫画吗?
计算机视觉与模式识别
2026-04-23 v3 计算与语言
摘要
当前的视觉语言模型(VLMs)在处理序列视觉叙事时,展现出表层识别与深层叙事推理之间的关键差距。通过对漫画叙事理解的全面调查,我们揭示出,尽管近期的大型多模态模型在单幅画面解读上表现出色,但它们在时间因果性和跨画面连贯性方面系统性地失败,而这两者是连贯故事理解的核心要求。我们引入了一个新颖的评估框架,该框架结合了细粒度多模态标注、跨模态嵌入分析和检索增强评估,以系统性地刻画这些局限性。我们的方法包括:(i) 一个严格的标注协议,通过对齐的轻小说文本将视觉元素与叙事结构联系起来;(ii) 跨多种推理范式的全面评估,包括直接推理和检索增强生成;(iii) 跨模态相似性分析,揭示当前视觉语言模型联合表征中的根本性错位。将此框架应用于《Re:从零开始的异世界生活》漫画的11个章节、308个标注画面,我们通过三个核心评估轴——生成式故事讲述、上下文对话基础和时序推理——对视觉语言模型的长篇叙事理解进行了首次系统研究。我们的发现表明,当前模型缺乏真正的故事级智能,尤其在处理非线性叙事、角色一致性和跨长序列的因果推理方面表现挣扎。这项工作为评估叙事智能奠定了基础并提供了实用方法,同时为多模态模型在离散视觉叙事中超越基本识别的深度序列理解能力提供了可操作的见解。项目页面:https://re-verse.vercel.app
引用
@article{arxiv.2508.08508,
title = {Re:Verse -- Can Your VLM Read a Manga?},
author = {Aaditya Baranwal and Madhav Kataria and Naitik Agrawal and Yogesh S Rawat and Shruti Vyas},
journal= {arXiv preprint arXiv:2508.08508},
year = {2026}
}
备注
Accepted (oral) at ICCV (AISTORY Workshop) 2025