中文

WinoGAViL: 挑战视觉-语言模型的游戏化关联基准

计算与语言 2022-10-12 v2 人工智能 计算机视觉与模式识别 人机交互

摘要

尽管视觉-语言模型在视觉问答等任务上表现良好,但在基础人类常识推理能力方面却存在困难。本文提出WinoGAViL:一种视觉-语言关联的在线游戏(例如狼人与满月之间的关联),用作动态评估基准。受流行卡牌游戏Codenames启发,一名间谍大师给出与若干视觉候选相关的文本线索,另一名玩家尝试识别它们。人类玩家因创造出对敌对AI模型而言具有挑战性、但仍可被其他人类玩家解出的关联而获得奖励。我们利用该游戏收集了3.5K个样本,发现它们对人类而言直观易懂(>90% Jaccard指数),但对最先进的AI模型具有挑战性,其中最佳模型(ViLT)取得52%的得分,且主要在线索具有视觉显著性时成功。我们的分析以及从玩家处收集的反馈表明,所收集的关联需要多样化的推理技能,包括通用知识、常识、抽象等。我们发布了数据集、代码与交互式游戏,支持未来的数据收集,可用于开发具有更好关联能力的模型。

关键词

引用

@article{arxiv.2207.12576,
  title  = {WinoGAViL: Gamified Association Benchmark to Challenge Vision-and-Language Models},
  author = {Yonatan Bitton and Nitzan Bitton Guetta and Ron Yosef and Yuval Elovici and Mohit Bansal and Gabriel Stanovsky and Roy Schwartz},
  journal= {arXiv preprint arXiv:2207.12576},
  year   = {2022}
}

备注

Accepted to NeurIPS 2022, Datasets and Benchmarks. Website: https://winogavil.github.io/