中文

IMDB-WIKI-SbS:一个用于众包成对比较的评估数据集

人机交互 2021-11-29 v2

摘要

如今,得益于使用众包制作的开放数据集(如SQuAD、MS COCO、ImageNet、SuperGLUE等),对大规模机器学习模型进行综合评估已成为可能。这些数据集捕捉客观响应,假定单一正确答案,因而无法捕捉主观人类感知。反之,成对比较任务——仅需在两个选项中择一——可将人的偏好纳入极具挑战的人工智能任务中,例如信息检索与推荐系统评估。遗憾的是,现有数据集要么规模小要么专有,减缓了从人类用户获取更好反馈的进展。本文中,我们提出IMDB-WIKI-SbS,一个用于评估成对比较的新大规模数据集。它包含出现在250,249个配对中的9,150张图像,标注于众包平台。我们的数据集利用知名IMDB-WIKI数据集作为基准真值,具有均衡的年龄与性别分布。我们描述了数据集的构建方式,并比较了若干基线方法,表明其适于模型评估。

关键词

引用

@article{arxiv.2110.14990,
  title  = {IMDB-WIKI-SbS: An Evaluation Dataset for Crowdsourced Pairwise Comparisons},
  author = {Nikita Pavlichenko and Dmitry Ustalov},
  journal= {arXiv preprint arXiv:2110.14990},
  year   = {2021}
}

备注

Accepted to NeurIPS Data-Centric AI Workshop