中文

缩放漫画:区域感知强化学习提升视觉-语言模型中的细粒度漫画理解

计算机视觉与模式识别 2025-11-11 v1 人工智能

摘要

复杂的视觉叙事(如漫画)对视觉-语言模型(VLMs)提出了重大挑战。尽管 VLMs 在自然图像上表现优异,但它们在处理风格化线稿、拟声词以及密集的多分格布局时常常遇到困难。为了填补这一空白,我们引入了 AI4VA-FG,这是首个用于基于 VLM 的漫画理解的细粒度综合基准。它涵盖了从基础识别与检测到高级角色推理与叙事构建的任务,并由密集的角色、姿态和深度标注提供支持。此外,我们评估了最先进的专有模型(包括 GPT-4o 和 Gemini-2.5)以及开源模型(如 Qwen2.5-VL),揭示了在我们的基准核心任务中存在显著的性能缺陷,并强调漫画理解仍是一个未解决的挑战。为了增强 VLMs 在该领域的能力,我们系统地研究了训练后策略,包括基于解的监督微调(SFT-S)、基于推理轨迹的监督微调(SFT-R)以及强化学习(RL)。此外,受新兴的“思考图像”范式启发,我们提出了针对 VLMs 的区域感知强化学习(RARL),该方法训练模型通过放大操作动态关注相关区域。我们观察到,当应用于 Qwen2.5-VL 模型时,RL 和 RARL 在低级实体识别和高级故事线排序方面产生了显著提升,为漫画领域中更准确、更高效的 VLM 应用铺平了道路。

关键词

引用

@article{arxiv.2511.06490,
  title  = {Zooming into Comics: Region-Aware RL Improves Fine-Grained Comic Understanding in Vision-Language Models},
  author = {Yule Chen and Yufan Ren and Sabine Süsstrunk},
  journal= {arXiv preprint arXiv:2511.06490},
  year   = {2025}
}