将模型失效模式提炼为潜空间中的方向
机器学习
2022-12-05 v2
摘要
现有用于隔离数据集中困难子群体与虚假相关性的方法通常需要人工干预,这使得这些方法劳动密集且依赖于特定数据集。为克服这些缺陷,我们提出了一种可扩展的方法,用于自动提炼模型的失效模式。具体而言,我们利用线性分类器识别一致的错误模式,并由此将这些失效模式自然地表示为特征空间内的方向。我们证明该框架能够发现并自动描述训练数据集中的困难子群体。此外,通过将我们的框架与现成的扩散模型相结合,我们可以生成对该分析模型尤其具有挑战性的图像,从而可用于执行合成数据增强,以缓解模型的失效模式。代码见 https://github.com/MadryLab/failure-directions
引用
@article{arxiv.2206.14754,
title = {Distilling Model Failures as Directions in Latent Space},
author = {Saachi Jain and Hannah Lawrence and Ankur Moitra and Aleksander Madry},
journal= {arXiv preprint arXiv:2206.14754},
year = {2022}
}