面向小型 MLLMs 的漫画忠实推理
计算机视觉与模式识别
2026-04-03 v2 人工智能
摘要
漫画理解是多模态大语言模型(MLLMs)面临的重大挑战之一,因为漫画的预期含义往往源自视觉、文本和社交线索的联合解读。这自然催生了链式思考(CoT)提示,因为显式的中间推理似乎有助于整合这些异构信号。然而,现有的CoT方法与这种结构不匹配:它们倾向于在考虑到多个线索后就将解释强制压缩为单一推理路径,往往会降低性能,尤其是对小型 MLLMs。我们的核心思想是而不是在监督构建过程中将漫画理解压缩为单一推理链,而是显式保留多线索解读。在此基础上,我们提出了一个面向小型 MLLMs 的漫画忠实推理的两阶段框架。首先,我们引入了 MoCoT—a 个模块化监督构建框架,保留多线索解读并将其转化为更加忠实的监督。其次,我们提出了 VERA—a 结构化奖励机制,通过将优化对齐推理忠实性和答案正确性,将此类监督转化为忠实的推理行为。在覆盖漫画理解以及更广泛的幽默导向和抽象视觉推理任务的五个基准上进行的大量实验表明,我们的框架在参数不足 4B 的模型中取得了强劲的成绩,超越了多个 7B 基线,平均提升了四个小型 MLLMs 的性能 12.1%,且作为插件式方法实现,持续提升推理忠实性,同时保持推理效率。
引用
@article{arxiv.2601.02991,
title = {Towards Faithful Reasoning in Comics for Small MLLMs},
author = {Chengcheng Feng and Haojie Yin and Yucheng Jin and Kaizhu Huang},
journal= {arXiv preprint arXiv:2601.02991},
year = {2026}
}