中文

VCU-Bridge:通过语义桥接的层次化视觉含义理解

计算机视觉与模式识别 2025-11-25 v1 人工智能

摘要

虽然多模态大语言模型(MLLM)在基准测试中表现出色,但其处理范式不同于人类将视觉信息与高层概念集成的能力。与人类天然桥接细节与高层概念不同,模型倾向于将这些元素孤立地处理。流行的评估协议常常将低级感知与高层推理分离,忽略它们的语义和因果依赖关系,这导致非诊断性的结果并遮蔽了性能瓶颈。我们提出VCU-Bridge,一个 operationalizes 人类类似的视觉含义理解层次结构的框架:从基础感知通过语义桥接到抽象含义的多层次推理,提供从具体线索到抽象结论的明确的证据到推断轨迹。建立在该框架之上,我们构建HVCU-Bench,用于层次化视觉含义理解的基准测试,包含明确的层次诊断。全面实验表明,随着推理进展到更高层次,性能始终存在下降。我们进一步开发了一个数据生成管道,用于受蒙特卡洦树搜索(MCTS)指导的指令调优,表明加强低级能力在高层次上可实现可衡量的收益。有趣的是,这不仅在HVCU-Bench上取得改进,还在一般基准测试中带来收益(平均+2.53%),特别是在MMStar上实现显著收益(+7.26%),这表明层次化思维模式及其在增强MLLM能力方面的有效性。项目页面位于https://vcu-bridge.github.io。

关键词

引用

@article{arxiv.2511.18121,
  title  = {VCU-Bridge: Hierarchical Visual Connotation Understanding via Semantic Bridging},
  author = {Ming Zhong and Yuanlei Wang and Liuzhou Zhang and Arctanx An and Renrui Zhang and Hao Liang and Ming Lu and Ying Shen and Wentao Zhang},
  journal= {arXiv preprint arXiv:2511.18121},
  year   = {2025}
}