中文

MetaphorStar:基于端到端视觉强化学习的数据图像隐喻理解与推理

计算机视觉与模式识别 2026-02-12 v1 人工智能 计算机与社会

摘要

图像隐喻理解仍是当代 AI 系统面临的关键挑战。虽然多模态大语言模型(Multimodal Large Language Models, MLLMs)在基础视觉问答(Visual Question Answering, VQA)中表现出色,但始终难以把握图像中蕴含的细微文化、情感与情境含义。这源于该任务需要复杂的多跳推理、文化语境和心理理论(Theory of Mind, ToM)能力,而当前模型均不具备。为填补这一空白,我们提出 MetaphorStar,即第一个用于图像隐喻任务的端到端视觉强化学习(RL)框架。我们的框架包括三个核心组件:细粒度数据集 TFQ-Data、视觉 RL 方法 TFQ-GRPO 以及结构化基准 TFQ-Bench。我们完全开源的 MetaphorStar 系列模型基于 TFQ-GRPO 在 TFQ-Data 上训练,平均性能提升 82.6%。与 20 多款主流 MLLMs 相比,MetaphorStar-32B 在多选问和开放式问答中实现最先进(SOTA),在真假问中显著超越顶级闭源模型 Gemini-3.0-pro。关键实验表明,学习图像隐喻任务可提升一般理解能力,尤其是复杂视觉推理能力。我们进一步系统性分析了模型参数规模、训练数据规模以及不同模型架构和训练策略的影响,展示了本方法的广泛适用性。我们在 https://metaphorstar.github.io 开源所有模型权重、数据集及方法代码。

关键词

引用

@article{arxiv.2602.10575,
  title  = {MetaphorStar: Image Metaphor Understanding and Reasoning with End-to-End Visual Reinforcement Learning},
  author = {Chenhao Zhang and Yazhe Niu and Hongsheng Li},
  journal= {arXiv preprint arXiv:2602.10575},
  year   = {2026}
}

备注

14 pages, 4 figures, 11 tables; Code: https://github.com/MING-ZCH/MetaphorStar, Model & Dataset: https://huggingface.co/collections/MING-ZCH/metaphorstar