中文

面向准确、公平与鲁棒模型的数据清洗:一种大数据与 AI 融合方法

数据库 2019-04-25 v1 机器学习

摘要

机器学习的广泛使用正在从根本上改变软件开发范式(亦称 Software 2.0),其中数据成为与代码同等的一等公民。随着机器学习被用于敏感应用,训练模型必须准确、公平且对攻击鲁棒变得至关重要。虽然已提出许多技术来改进模型训练过程(处理中方法)或训练好的模型本身(处理后方法),但我们认为最有效的方法是从错误的根源——模型所训练的数据(预处理)——进行清洗。历史上,至少有三个研究社区分别研究此问题:数据管理、机器学习(模型公平)和安全。尽管每个社区都做了大量研究,但最终必须预处理相同的数据集,且很少理解这些技术如何相互关联并可能集成。我们主张是时候扩展数据清洗的概念以满足现代机器学习需求。我们识别数据预处理技术之间的依赖关系,并提出 MLClean,一个集成这些技术并帮助训练准确且公平模型的统一数据清洗框架。本工作是大数据——人工智能 (AI) 融合这一更广泛趋势的一部分。

关键词

引用

@article{arxiv.1904.10761,
  title  = {Data Cleaning for Accurate, Fair, and Robust Models: A Big Data - AI Integration Approach},
  author = {Ki Hyun Tae and Yuji Roh and Young Hun Oh and Hyunsu Kim and Steven Euijong Whang},
  journal= {arXiv preprint arXiv:1904.10761},
  year   = {2019}
}

备注

4 pages