Toloka 视觉问答基准数据集
计算机视觉与模式识别
2023-09-29 v1 人工智能
计算与语言
人机交互
摘要
在本文中,我们提出 Toloka Visual Question Answering,一个新颖的众包数据集,可用于在视觉问答定位任务中将机器学习系统的性能与非专家人类水平进行比较。在该任务中,给定一张图像和一个文本问题,需要围绕正确回答该问题的对象绘制边界框。每个图像-问题对都包含响应,且每张图像仅有一个正确响应。我们的数据集包含 45,199 个英文图像-问题对,附带真实边界框,并划分为训练集和两个测试子集。除了描述该数据集并在 CC BY 许可下发布外,我们还在开源零样本基线模型上进行了一系列实验,并在 WSDM Cup 上组织了吸引全球 48 名参与者的多阶段竞赛。然而,截至论文提交时,根据交并比(IoU)评估分数,没有任何机器学习模型超越非专家众包基线。
引用
@article{arxiv.2309.16511,
title = {Toloka Visual Question Answering Benchmark},
author = {Dmitry Ustalov and Nikita Pavlichenko and Sergey Koshelev and Daniil Likhobaba and Alisa Smirnova},
journal= {arXiv preprint arXiv:2309.16511},
year = {2023}
}
备注
16 pages; see https://toloka.ai/challenges/wsdm2023/ for more details