WinoViz:探究不同状态下对象的视觉属性
计算与语言
2024-02-22 v1
摘要
人类基于特定语境感知和理解对象的不同视觉属性。例如,我们知道香蕉“腐烂时”会变褐,而“未成熟时”呈绿色。以往关于探究视觉常识知识的研究主要集中在考察语言模型对对象典型属性(如颜色和形状)的理解。我们提出了 WinoViz,这是一个仅文本的评估数据集,包含 1,380 个样本,旨在探究语言模型在不同语境或状态下对对象可变视觉属性的推理能力。我们的任务具有挑战性,因为它需要语用推理(寻找预期含义)和视觉知识推理。我们还提出了多跳数据,这是我们要任务的更具挑战性的版本,需要多步推理链来解决。在实验分析中,我们的发现如下:a) 像 GPT-4 这样的大型语言模型表现出有效的性能,但在处理多跳数据时,其性能显著下降。b) 大型模型在语用推理方面表现良好,但视觉知识推理是我们任务中的瓶颈。c) 视觉 - 语言模型的表现优于其纯语言模型对应物。d) 使用机器生成图像的模型在我们的任务中表现不佳,这是由于生成图像的质量较差所致。
引用
@article{arxiv.2402.13584,
title = {WinoViz: Probing Visual Properties of Objects Under Different States},
author = {Woojeong Jin and Tejas Srinivasan and Jesse Thomason and Xiang Ren},
journal= {arXiv preprint arXiv:2402.13584},
year = {2024}
}
备注
Preprint