中文

基于科学图像的 GPT-Vision 能力 grounded intuition

计算与语言 2023-11-06 v1

摘要

GPT-Vision 在一系列视觉-语言任务上令我们印象深刻,但它带来了熟悉的新挑战:我们对其能力与局限几乎一无所知。在我们的研究中,我们形式化了一个许多人已本能尝试的过程,以建立对这一新模型的“grounded intuition”。受近期从基准测试转向示例驱动定性评估的启发,我们借鉴社会科学与人机交互中的扎根理论与主题分析,为自然语言处理中的定性评估建立了一个严谨框架。我们使用该技术考察科学图形的替代文本生成,发现 GPT-Vision 对提示、图像中的反事实文本以及相对空间关系尤为敏感。我们的方法与分析旨在帮助研究者快速建立自身对新模型的 grounded intuition,同时揭示如何应用 GPT-Vision 使信息更易获取。

关键词

引用

@article{arxiv.2311.02069,
  title  = {Grounded Intuition of GPT-Vision's Abilities with Scientific Images},
  author = {Alyssa Hwang and Andrew Head and Chris Callison-Burch},
  journal= {arXiv preprint arXiv:2311.02069},
  year   = {2023}
}