中文

LLM 瓶颈:为何开源视觉 LLM 在层次化视觉识别中表现挣扎

计算机视觉与模式识别 2026-03-27 v2 人工智能 计算与语言 机器学习

摘要

本文揭示,许多开源大语言模型缺乏关于我们视觉世界的层次化知识,甚至不知道公认的生物学分类法。这一缺陷使得 LLM 成为视觉 LLM 层次化视觉识别(例如,能识别海葵鱼但无法识别脊椎动物)的瓶颈。我们使用从六种分类法和四个图像数据集构建的约 100 万个四选一视觉问答(VQA)任务得出了这些发现。有趣的是,使用我们的 VQA 任务微调视觉 LLM 再次证实了 LLM 的瓶颈效应,因为 VQA 任务对 LLM 层次化一致性的提升超过了其对视觉 LLM 的提升。我们推测,在 LLM 掌握相应的分类学知识之前,无法使开源视觉 LLM 按层次结构理解视觉概念。

关键词

引用

@article{arxiv.2505.24840,
  title  = {The LLM Bottleneck: Why Open-Source Vision LLMs Struggle with Hierarchical Visual Recognition},
  author = {Yuwen Tan and Yuan Qing and Boqing Gong},
  journal= {arXiv preprint arXiv:2505.24840},
  year   = {2026}
}

备注

Accepted to CVPR 2026. Project page and code: https://yuanqing-ai.github.io/llm-hierarchy/