面向文本引导扰动的鲁棒性基准测试
计算机视觉与模式识别
2023-08-01 v2
摘要
本研究考察图像分类器对文本引导扰动的鲁棒性。我们利用扩散模型将图像编辑至不同域。不同于其他使用合成或人工挑选数据作基准的工作,我们采用扩散模型,因其为能够学习编辑图像同时保留语义内容的生成模型。因而扰动将更真实,比较也更具信息量。此外,无需人工标注,我们便可以更少代价创建大规模基准。我们基于原始ImageNet层次定义提示层次以在不同域中施加编辑。除引入新基准外,我们亦尝试考察不同视觉模型的鲁棒性。本研究结果表明,图像分类器性能在不同基于语言的扰动与编辑域中显著下降。我们还观察到卷积模型比transformer架构更鲁棒。另外,我们看到常见数据增强技术可提升在原始数据与编辑图像上的性能。本研究发现有助于改进图像分类器设计,并促进更鲁棒机器学习系统的发展。生成该基准的代码见https://github.com/ckoorosh/RobuText。
引用
@article{arxiv.2304.02963,
title = {Benchmarking Robustness to Text-Guided Corruptions},
author = {Mohammadreza Mofayezi and Yasamin Medghalchi},
journal= {arXiv preprint arXiv:2304.02963},
year = {2023}
}
备注
Accepted to CVPRW 2023