挖掘数据集潜力:一种面向模型鲁棒性的以数据为中心方法
机器学习
2022-03-11 v1
摘要
深度神经网络(DNNs)对恶意扰动的鲁棒性是可信 AI 中的热点问题。现有技术在给定固定数据集的情况下获得鲁棒模型,或通过修改模型结构,或通过优化推理或训练过程。尽管已取得显著进展,但构建用于模型鲁棒性的高质量数据集的可能性仍未被探索。遵循 Andrew Ng 发起的以数据为中心的 AI 运动,我们提出了一种新颖的数据集增强算法,该算法适用于许多现有 DNN 模型以提升鲁棒性。我们优化后的数据集中包含了可迁移对抗样本和 14 种常见 corruption。在由阿里巴巴集团和清华大学主办的以数据为中心的鲁棒学习竞赛中,我们的算法在第一阶段从 3000 多名参赛者中位列第三,而在第二阶段排名第四。我们的代码可在 \url{https://github.com/hncszyq/tianchi_challenge} 获取。
引用
@article{arxiv.2203.05323,
title = {Exploiting the Potential of Datasets: A Data-Centric Approach for Model Robustness},
author = {Yiqi Zhong and Lei Wu and Xianming Liu and Junjun Jiang},
journal= {arXiv preprint arXiv:2203.05323},
year = {2022}
}
备注
Accepted by the AAAI2022 Workshop on Adversarial Machine Learning and Beyond as a competition paper