增强与评估:面向以数据为中心AI的数据增强流水线
机器学习
2021-12-08 v1
摘要
数据稀缺与噪声是机器学习工业应用中的重要问题。然而,鉴于黑盒模型,设计可扩展且通用的方案以解决数据集基本的分布与语义属性通常具有挑战性。为此,以数据为中心的方法对机器学习运维流水线的自动化至关重要。作为该自动化的基础,我们提出一种领域无关的流水线,用于改善图像分类问题中数据的质量。该流水线包含数据评估、清洗与增强。通过恰当组合这些方法,我们仅使用所提供的数据集,在以数据为中心的AI竞赛中达到了84.711%的测试准确率(排名#6,最具创新性荣誉提名)。
引用
@article{arxiv.2112.03837,
title = {Augment & Valuate : A Data Enhancement Pipeline for Data-Centric AI},
author = {Youngjune Lee and Oh Joon Kwon and Haeju Lee and Joonyoung Kim and Kangwook Lee and Kee-Eung Kim},
journal= {arXiv preprint arXiv:2112.03837},
year = {2021}
}
备注
Data Centric AI Workshop at NeurIPS 2021