中文

构建公平训练数据集的自适应采样策略

机器学习 2022-02-04 v1 人工智能 统计方法学

摘要

从计算机视觉到自然语言处理等领域,机器学习模型已被证明存在显著的差异,通常对传统上服务不足群体的成员表现更差。导致这些性能差距的一个因素是模型训练数据缺乏代表性。然而,如何在特定应用中将代表性操作化往往并不清晰。在此我们形式化了创建公平训练数据集的问题,并提出了解决该问题的统计框架。我们考虑这样一种设定:模型构建者必须决定如何将固定的数据收集预算分配给从不同子群收集训练数据。随后我们将数据集创建框定为约束优化问题,其中基于(估计的)群组特定学习率和每样本成本,最大化群组特定性能度量的函数。这种灵活方法纳入了模型构建者及其他利益相关者的偏好,以及学习任务的统计特性。当数据收集决策顺序做出时,我们表明在某些条件下,即便缺乏学习率的先验知识,该优化问题也能被高效求解。为说明我们的方法,我们对合成基因组数据上的多基因风险评分进行了模拟研究——这是一个常受非代表性数据收集困扰的应用领域。我们发现,我们的自适应采样策略优于若干常见数据收集启发式方法,包括均等采样与比例采样,展示了战略性数据集设计对于构建公平模型的价值。

关键词

引用

@article{arxiv.2202.01327,
  title  = {Adaptive Sampling Strategies to Construct Equitable Training Datasets},
  author = {William Cai and Ro Encarnacion and Bobbie Chern and Sam Corbett-Davies and Miranda Bogen and Stevie Bergman and Sharad Goel},
  journal= {arXiv preprint arXiv:2202.01327},
  year   = {2022}
}

备注

15 pages, 2 figures