中文

TouchStone:用语言模型评估视觉-语言模型

计算机视觉与模式识别 2023-09-06 v2 计算与语言

摘要

大型视觉-语言模型(LVLMs)近来取得了快速发展,展现出通过将视觉接收器与大型语言模型(LLMs)连接来感知、理解和处理视觉信息的卓越能力。然而,当前的评估主要关注识别和推理能力,缺乏对对话技能的直接评估,且忽视了视觉叙事能力。在本文中,我们提出了一种评估方法,使用强 LLMs 作为评判者来全面评估 LVLMs 的各种能力。首先,我们构建了一个全面的视觉对话数据集 TouchStone,由开放世界图像和问题组成,涵盖五大类能力和 27 个子任务。该数据集不仅涵盖基础识别与理解,还扩展到文学创作。其次,通过整合详细的图像标注,我们有效地将多模态输入内容转化为 LLMs 可理解的形式。这使我们能够采用先进的 LLMs 直接在无需人工干预的情况下评估多模态对话的质量。通过验证,我们证明了强大的 LVLMs(如 GPT-4)可以仅利用其文本能力有效对对话质量打分,并与人类偏好一致。我们希望我们的工作能作为 LVLMs 评估的试金石,并为构建更强的 LVLMs 铺平道路。评估代码可在 https://github.com/OFA-Sys/TouchStone 获取。

关键词

引用

@article{arxiv.2308.16890,
  title  = {TouchStone: Evaluating Vision-Language Models by Language Models},
  author = {Shuai Bai and Shusheng Yang and Jinze Bai and Peng Wang and Xingxuan Zhang and Junyang Lin and Xinggang Wang and Chang Zhou and Jingren Zhou},
  journal= {arXiv preprint arXiv:2308.16890},
  year   = {2023}
}

备注

https://github.com/OFA-Sys/TouchStone