LLM 瓶颈:为何开源视觉 LLM 在层次化视觉识别中表现挣扎
计算机视觉与模式识别
2026-03-27 v2 人工智能
计算与语言
机器学习
摘要
本文揭示,许多开源大语言模型缺乏关于我们视觉世界的层次化知识,甚至不知道公认的生物学分类法。这一缺陷使得 LLM 成为视觉 LLM 层次化视觉识别(例如,能识别海葵鱼但无法识别脊椎动物)的瓶颈。我们使用从六种分类法和四个图像数据集构建的约 100 万个四选一视觉问答(VQA)任务得出了这些发现。有趣的是,使用我们的 VQA 任务微调视觉 LLM 再次证实了 LLM 的瓶颈效应,因为 VQA 任务对 LLM 层次化一致性的提升超过了其对视觉 LLM 的提升。我们推测,在 LLM 掌握相应的分类学知识之前,无法使开源视觉 LLM 按层次结构理解视觉概念。
引用
@article{arxiv.2505.24840,
title = {The LLM Bottleneck: Why Open-Source Vision LLMs Struggle with Hierarchical Visual Recognition},
author = {Yuwen Tan and Yuan Qing and Boqing Gong},
journal= {arXiv preprint arXiv:2505.24840},
year = {2026}
}
备注
Accepted to CVPR 2026. Project page and code: https://yuanqing-ai.github.io/llm-hierarchy/