Prometheus-Vision:以视觉语言模型作为细粒度评估的裁判
计算与语言
2024-01-15 v1
摘要
评估视觉语言模型(VLM)生成的长篇回答颇具挑战。这不仅需要检查 VLM 是否遵循给定指令,还需验证文本输出是否恰当地基于给定图像。受近期用语言模型评估语言模型的方法启发,本文提出用 VLM 评估 VLM。为此,我们发布了一个名为“感知合集”(Perception Collection)的新反馈数据集,包含 15K 条用户在评估时可能关心的自定义评分细则。利用该数据集,我们训练了 Prometheus-Vision——首个能在评估过程中理解用户自定义评分标准的开源 VLM 评估模型。在开源模型中,Prometheus-Vision 与人类评估者及 GPT-4V 的皮尔逊相关性最高,彰显了其在实现透明、可及的 VLM 评估方面的有效性。我们在 https://github.com/kaistAI/prometheus-vision 开源了代码、数据集与模型。
引用
@article{arxiv.2401.06591,
title = {Prometheus-Vision: Vision-Language Model as a Judge for Fine-Grained Evaluation},
author = {Seongyun Lee and Seungone Kim and Sue Hyun Park and Geewook Kim and Minjoon Seo},
journal= {arXiv preprint arXiv:2401.06591},
year = {2024}
}
备注
Work in progress