数据去偏与数据模型(D3M):通过数据选择提高子群鲁棒性
机器学习
2024-06-25 v1 计算机与社会
机器学习
摘要
机器学习模型在训练时 underrepresented的子群上可能失效。虽然数据平衡等技术可以提高低绩效组的性能,但需要获取训练组注释,且可能最终会删除数据集的大部分。本文我们引入数据去偏与数据模型(D3M),这是一种去偏方法,通过隔离和移除导致模型在少数派组别上失败的特定训练示例。我们的做法使我们能够在仅移除少量示例的同时高效训练去偏分类器,且无需训练组注释或额外的超参数调优。
引用
@article{arxiv.2406.16846,
title = {Data Debiasing with Datamodels (D3M): Improving Subgroup Robustness via Data Selection},
author = {Saachi Jain and Kimia Hamidieh and Kristian Georgiev and Andrew Ilyas and Marzyeh Ghassemi and Aleksander Madry},
journal= {arXiv preprint arXiv:2406.16846},
year = {2024}
}