IMDB-WIKI-SbS:一个用于众包成对比较的评估数据集
人机交互
2021-11-29 v2
摘要
如今,得益于使用众包制作的开放数据集(如SQuAD、MS COCO、ImageNet、SuperGLUE等),对大规模机器学习模型进行综合评估已成为可能。这些数据集捕捉客观响应,假定单一正确答案,因而无法捕捉主观人类感知。反之,成对比较任务——仅需在两个选项中择一——可将人的偏好纳入极具挑战的人工智能任务中,例如信息检索与推荐系统评估。遗憾的是,现有数据集要么规模小要么专有,减缓了从人类用户获取更好反馈的进展。本文中,我们提出IMDB-WIKI-SbS,一个用于评估成对比较的新大规模数据集。它包含出现在250,249个配对中的9,150张图像,标注于众包平台。我们的数据集利用知名IMDB-WIKI数据集作为基准真值,具有均衡的年龄与性别分布。我们描述了数据集的构建方式,并比较了若干基线方法,表明其适于模型评估。
引用
@article{arxiv.2110.14990,
title = {IMDB-WIKI-SbS: An Evaluation Dataset for Crowdsourced Pairwise Comparisons},
author = {Nikita Pavlichenko and Dmitry Ustalov},
journal= {arXiv preprint arXiv:2110.14990},
year = {2021}
}
备注
Accepted to NeurIPS Data-Centric AI Workshop