中文

GPT-4V(ision) 作为视觉-语言任务的通用评估器

计算机视觉与模式识别 2023-11-03 v1 计算与语言

摘要

自动评估视觉-语言任务具有挑战性,尤其在反映人类判断方面,由于难以考量细粒度细节而存在局限。尽管 GPT-4V 在多种多模态任务中展现出前景,但将其作为此类任务的通用评估器尚未被系统探索。我们全面验证 GPT-4V 用于评估的能力,涵盖从基础的图像到文本与文本到图像合成,到高层图像到图像翻译及多图像到文本对齐等任务。我们采用单答案评分与成对比较两种评估方法,使用 GPT-4V。值得注意的是,GPT-4V 在各任务与评估方法下均展现出与人类判断的良好一致性,表明多模态 LLM 作为评估器具有巨大潜力。尽管存在如视觉清晰度评分受限与真实世界复杂推理等不足,其提供与人类对齐的评分并附详尽解释的能力,对通用自动评估器而言颇具前景。

关键词

引用

@article{arxiv.2311.01361,
  title  = {GPT-4V(ision) as a Generalist Evaluator for Vision-Language Tasks},
  author = {Xinlu Zhang and Yujie Lu and Weizhi Wang and An Yan and Jun Yan and Lianke Qin and Heng Wang and Xifeng Yan and William Yang Wang and Linda Ruth Petzold},
  journal= {arXiv preprint arXiv:2311.01361},
  year   = {2023}
}