中文

MetaphorVU:面向隐喻视频理解的基准

计算机视觉与模式识别 2026-05-26 v1

摘要

隐喻视频在 various 实际场景中广泛存在,旨在传递复杂概念,理解它们通常需要高阶认知能力。缺乏对隐喻视频理解的系统性研究不仅限制了 MLLMs 的实际应用,还阻碍了对其高阶认知能力的彻底评估。为填补这一差距,我们提出 MetaphorVU-Bench,即第一个专注于隐喻视频理解的系统且全面的基准。通过实验,我们发现当前 MLLMs 在准确的隐喻视频理解方面存在显著不足,主要因跨域映射存在缺陷。基于此发现,我们构建了隐喻知识图谱作为映射增强,并提出 MetaphorBoost 推理时增强框架,实现持续的性能提升。我们的基准、分析与方法为未来推动 MLLMs 提前提供了有益见解与基础。

关键词

引用

@article{arxiv.2605.25461,
  title  = {MetaphorVU: Towards Metaphorical Video Understanding},
  author = {Zhuoqun Li and Boxi Cao and Guiping Jiang and Fangrui Lv and Ruotong Pan and Jianan Wang and Xiangyu Wu and Hongyu Lin and Yaojie Lu and Yong Du and Ruyin Jia and Liyan and Tingting Gao and Han Li and Xianpei Han and Le Sun},
  journal= {arXiv preprint arXiv:2605.25461},
  year   = {2026}
}

备注

ICML 2026 spotlight