中文

数据中的缺陷:ImageNet 如何误表征生物多样性

计算机视觉与模式识别 2022-08-25 v1 计算机与社会 机器学习

摘要

ImageNet-1k 是一个常用于基准测试机器学习(ML)模型及评估图像识别与目标检测等任务的数据集。野生动物占 ImageNet-1k 的 27%,但与代表人和物体的类别不同,这些数据未被仔细审查。在本文中,我们在生态学家专家的参与下,分析了 ImageNet-1k 验证集中代表野生动物的来自 269 个类别的 13,450 张图像。我们发现许多类别定义不清或相互重叠,且 12% 的图像被错误标注,有些类别超过 90% 的图像有误。我们还发现 ImageNet-1k 中涉及的野生动物相关标签和图像存在显著的地理与文化偏差,以及如人工动物、同图多物种或有人出现等歧义。我们的发现凸显了该数据集广泛用于评估 ML 系统、此类算法用于野生动物相关任务以及更广义上 ML 数据集常见创建与整理方式的严重问题。

关键词

引用

@article{arxiv.2208.11695,
  title  = {Bugs in the Data: How ImageNet Misrepresents Biodiversity},
  author = {Alexandra Sasha Luccioni and David Rolnick},
  journal= {arXiv preprint arXiv:2208.11695},
  year   = {2022}
}