中文

从像素到提示:视觉语言模型

人工智能 2026-05-19 v2

摘要

当你今天读一篇关于新视觉语言模型的论文时,很容易忘记这种想法多久以前并不那么常见。教会机器看虽然已经很难了。教会它们阅读和生成语言也已经很难了。让它们同时做到这两点——然后进行推理、回答问题、遵循指令,甚至时而惊讶于此——仍然带有一丝科幻色彩,尽管如此正在成为常态。本书源于一种简单感觉:容易迷失。该领域发展迅速,新的模型名称不断出现,“我知道这些 buzzword”与“我实际上理解其工作原理”之间的差距可能会感到不够舒适。我多次感受到这一点。如果你正在阅读本书,你很可能也有同样的感觉。我的目标并非提供每个数据集、基准和新模型变体的详尽目录。相反,我希望提供的东西更为谦逊——且我希望它更耐用:为视觉语言模型提供清晰的心智地图。足够的结构,使你能够自信地阅读新论文;足够的直觉,使你能够在不感到像在盲目拼装积木的情况下设计自己的系统。

关键词

引用

@article{arxiv.2605.07544,
  title  = {From Pixels to Prompts: Vision-Language Models},
  author = {Khang Hoang Nhat Vo},
  journal= {arXiv preprint arXiv:2605.07544},
  year   = {2026}
}