中文

DatasetEquity:所有样本生而平等吗?探寻数据集内的公平性

计算机视觉与模式识别 2023-08-23 v2 机器学习

摘要

数据不平衡是机器学习领域中一个众所周知的问题,可归因于数据收集成本、标注难度以及数据的地理分布。在计算机视觉中,由图像外观导致的数据分布偏差仍高度未被探索。与使用类标签的类别分布相比,图像外观揭示了超越类标签所提供的对象间复杂关系。对从原始像素提取的深度感知特征进行聚类,可给出更丰富的数据表示。本文提出一种解决机器学习中数据不平衡的新方法。该方法利用深度感知嵌入与聚类,基于图像外观计算样本似然度,随后在训练中使用提出的 Generalized Focal Loss\textbf{Generalized Focal Loss} 函数对这些样本施以不同权重。该损失可轻松与深度学习算法集成。实验在包括 KITTI 与 nuScenes 的自动驾驶视觉数据集上验证了方法的有效性。该损失函数改进了最先进的 3D 目标检测方法,在 KITTI 数据集中代表性不足类别(Cyclist)上取得超过 200%200\% 的 AP 增益。结果表明该方法具有泛化性,可补充现有技术,并对较小数据集与稀有类别尤为有益。代码见:https://github.com/towardsautonomy/DatasetEquity

关键词

引用

@article{arxiv.2308.09878,
  title  = {DatasetEquity: Are All Samples Created Equal? In The Quest For Equity Within Datasets},
  author = {Shubham Shrivastava and Xianling Zhang and Sushruth Nagesh and Armin Parchami},
  journal= {arXiv preprint arXiv:2308.09878},
  year   = {2023}
}

备注

ICCV 2023 Workshop