中文

NL-Eye:图像上的归纳自然语言推理

计算机视觉与模式识别 2024-10-04 v1 人工智能 计算与语言

摘要

如果视觉语言模型(VLM)的机器人检测到湿滑地面,是否会警告我们会滑倒?近期的VLM展现了令人印象深刻的能力,但其推理结果和原因的能力仍未得到充分探索。为此,我们引入NL-Eye,一个旨在评估VLM视觉归纳推理技能的基准。NL-Eye将归纳自然语言推理(NLI)任务适应到视觉领域,要求模型根据前提图像评估假设图像的合理性并解释其决策。NL-Eye包含350个精心挑选的三元组示例(1,050张图像),涵盖多样化的推理类别:物理、功能、逻辑、情感、文化和社会。数据精选过程包含两个步骤——撰写文本描述和使用文本到图像模型生成图像,两者都需要大量人工参与以确保高质量且具挑战性的场景。我们的实验表明,VLM在NL-Eye上表现严重不足,往往达到随机基准水平,而人类在可信度预测和解释质量方面都表现出色。这表明现代VLM在归纳推理能力上存在不足。NL-Eye标志着发展具备稳健多模态推理能力的VLM的关键一步,包括防止事故的机器人和生成视频验证等实际应用。

关键词

引用

@article{arxiv.2410.02613,
  title  = {NL-Eye: Abductive NLI for Images},
  author = {Mor Ventura and Michael Toker and Nitay Calderon and Zorik Gekhman and Yonatan Bitton and Roi Reichart},
  journal= {arXiv preprint arXiv:2410.02613},
  year   = {2024}
}