端到端机器学习中的负责任AI挑战
机器学习
2021-01-18 v1 人工智能
摘要
随着AI广泛应用于日常生活,负责任AI变得至关重要。许多公开部署AI的公司声明,在训练模型时不仅需提升准确率,还需保证模型不歧视用户(公平性)、对噪声或投毒数据具有韧性(鲁棒性)、可解释等。此外,这些目标不仅与模型训练相关,也与端到端机器学习的各步骤相关,包括数据收集、数据清洗与验证、模型训练、模型评估以及模型管理与服务。最后,负责任AI在概念上具有挑战性,且对所有目标的支持须尽可能简便。因此我们提出迈向该愿景的三个关键研究方向——深度、广度与可用性——以衡量进展并介绍我们进行中的研究。首先,负责任AI必须得到深度支持,即公平性、鲁棒性等多目标须协同处理。为此,我们提出FR-Train,一种在存在数据偏置与投毒情况下进行公平且鲁棒模型训练的整体框架。其次,负责任AI须得到广泛支持,最好覆盖机器学习所有步骤。当前我们聚焦数据预处理步骤,提出Slice Tuner(一种用于训练公平准确模型的选择性数据获取框架)与MLClean(一种同时提升公平性与鲁棒性的数据清洗框架)。最后,负责任AI须具备可用性,即技术须易于部署且可操作。我们提出FairBatch(一种有效且易用的公平性批次选择方法)与Slice Finder(一种自动发现问题切片的模型评估工具)。我们认为仅触及了端到端机器学习中负责任AI的表层,并提出了未来的研究挑战。
引用
@article{arxiv.2101.05967,
title = {Responsible AI Challenges in End-to-end Machine Learning},
author = {Steven Euijong Whang and Ki Hyun Tae and Yuji Roh and Geon Heo},
journal= {arXiv preprint arXiv:2101.05967},
year = {2021}
}