用于视觉模型诊断的语义图像攻击
计算机视觉与模式识别
2023-03-24 v1 人工智能
机器学习
摘要
在实践中,在特定训练与测试数据集上的指标分析并不能保证机器学习模型可靠或公平。这部分是因为获取平衡、多样且标注完美的数据集通常昂贵、耗时且易出错。本文提出语义图像攻击(SIA),一种基于对抗攻击的方法,可提供语义对抗图像以实现模型诊断、可解释性与鲁棒性,而非依赖精心设计的测试集来评估机器学习模型的失败、公平性或鲁棒性。传统对抗训练是一种流行的使机器学习模型抵御攻击的鲁棒化方法。然而,现有对抗方法未能结合使模型缺陷可解释与分析的两个方面:语义可追溯性与感知质量。SIA通过在对预定义语义属性空间与图像空间上进行迭代梯度上升,将这两大特性结合起来。我们在关键点检测与分类的三种场景中验证了方法的有效性。(1)模型诊断:SIA生成属性直方图,突出机器学习模型的语义脆弱性(即导致模型失败的属性)。(2)更强攻击:SIA生成具有视觉可解释属性的对抗样本,其攻击成功率高于基线方法。基于SIA的对抗训练提升了跨不同基于梯度的攻击的可迁移鲁棒性。(3)对不平衡数据集的鲁棒性:我们使用SIA增广代表性不足的类,其优于强增广与重平衡基线。
引用
@article{arxiv.2303.13010,
title = {Semantic Image Attack for Visual Model Diagnosis},
author = {Jinqi Luo and Zhaoning Wang and Chen Henry Wu and Dong Huang and Fernando De la Torre},
journal= {arXiv preprint arXiv:2303.13010},
year = {2023}
}
备注
Initial version submitted to NeurIPS 2022