中文

TrustGAN:通过生成对抗网络训练安全可信的深度学习模型

机器学习 2023-11-13 v1 计算机视觉与模式识别

摘要

深度学习模型已为多种任务而开发,并每天部署于真实条件下工作。其中一些任务至关重要,模型需要可信且安全,例如军事通信或癌症诊断。这些模型被给予真实数据、模拟数据或二者组合,并训练得对它们具有高度预测性。然而,收集足够的真实数据或模拟它们以代表所有真实条件,是昂贵的,有时因保密性而无法实现,且大多数时候是不可能的。事实上,真实条件不断变化,有时不可处理。一种解决方案是部署能够在足够置信时给出预测、否则发出标志或弃权的机器学习模型。一个问题是标准模型很容易无法检测分布外样本,而其预测不可靠。我们在此提出 TrustGAN,一种面向可信性的生成对抗网络流水线。它是一个深度学习流水线,可在不影响目标模型预测能力的情况下改进其对置信度的估计。该流水线可接受任何给定的输出预测及该预测置信度的深度学习模型。此外,流水线无需修改此目标模型。因此它可轻松部署于 MLOps(机器学习运维)环境中。该流水线在此应用于一个在 MNIST 数据上训练以基于图像识别数字的目标分类模型。我们比较了标准方式训练与 TrustGAN 训练的此类模型。我们表明,在分布外样本(此处为 FashionMNIST 和 CIFAR10)上,估计置信度大幅降低。对于在 AugMod 的 1D 无线电信号上训练、在 RML2016.04C 上测试的分类模型,我们观察到类似结论。我们也公开发布了代码。

关键词

引用

@article{arxiv.2211.13991,
  title  = {TrustGAN: Training safe and trustworthy deep learning models through generative adversarial networks},
  author = {Hélion du Mas des Bourboux},
  journal= {arXiv preprint arXiv:2211.13991},
  year   = {2023}
}

备注

8 pages, 6 figures, 1 table, presented at CAID 2022: Conference on Artificial Intelligence for Defence