表征至关重要:评估训练数据中子群分配的重要性
机器学习
2021-06-08 v2 机器学习
摘要
收集更具多样性和代表性的训练数据常被鼓吹为缓解机器学习预测器在各子群体间性能差异的良方。然而,用于精确理解诸如多样性等数据集属性如何影响学习结果的框架在很大程度上仍属缺失。通过将数据收集视为学习过程的一部分,我们论证训练数据中的多样表征不仅是提升子群性能的关键,也是实现总体层面目标的关键。我们的分析与实验描述了数据集构成如何影响性能,并提供了建设性结果,用于利用现有数据中的趋势以及领域知识,以帮助指导有意的、感知目标的(objective-aware)数据集设计。
引用
@article{arxiv.2103.03399,
title = {Representation Matters: Assessing the Importance of Subgroup Allocations in Training Data},
author = {Esther Rolf and Theodora Worledge and Benjamin Recht and Michael I. Jordan},
journal= {arXiv preprint arXiv:2103.03399},
year = {2021}
}
备注
Accepted to ICML 2021; 31 pages,9 figures