模型修补:利用数据增强缩小子组性能差距
机器学习
2020-08-18 v1 人工智能
计算机视觉与模式识别
机器学习
摘要
机器学习中的分类器在部署时往往脆弱。尤其令人担忧的是模型在某一类的特定子组上性能不一致,例如,在存在或不存在虚假绷带的情况下皮肤癌分类表现出差异。为减轻这些性能差异,我们引入模型修补(model patching),一个两阶段框架,用于提升鲁棒性,促使模型对子组差异保持不变,并关注子组共享的类别信息。模型修补首先建模类内子组特征并学习它们之间的语义变换,然后利用刻意操纵子组特征的数据增强训练分类器。我们用CAMEL实例化模型修补,其(1)使用CycleGAN学习类内、子组间的增强,(2)使用理论驱动的子组一致性正则化器配合新的鲁棒目标来平衡子组性能。我们在3个基准数据集上展示了CAMEL的有效性,相对于最佳基线鲁棒误差降低高达33%。最后,CAMEL成功修补了一个因真实世界皮肤癌数据集上的虚假特征而失效的模型。
引用
@article{arxiv.2008.06775,
title = {Model Patching: Closing the Subgroup Performance Gap with Data Augmentation},
author = {Karan Goel and Albert Gu and Yixuan Li and Christopher Ré},
journal= {arXiv preprint arXiv:2008.06775},
year = {2020}
}