中文

面向文本引导扰动的鲁棒性基准测试

计算机视觉与模式识别 2023-08-01 v2

摘要

本研究考察图像分类器对文本引导扰动的鲁棒性。我们利用扩散模型将图像编辑至不同域。不同于其他使用合成或人工挑选数据作基准的工作,我们采用扩散模型,因其为能够学习编辑图像同时保留语义内容的生成模型。因而扰动将更真实,比较也更具信息量。此外,无需人工标注,我们便可以更少代价创建大规模基准。我们基于原始ImageNet层次定义提示层次以在不同域中施加编辑。除引入新基准外,我们亦尝试考察不同视觉模型的鲁棒性。本研究结果表明,图像分类器性能在不同基于语言的扰动与编辑域中显著下降。我们还观察到卷积模型比transformer架构更鲁棒。另外,我们看到常见数据增强技术可提升在原始数据与编辑图像上的性能。本研究发现有助于改进图像分类器设计,并促进更鲁棒机器学习系统的发展。生成该基准的代码见https://github.com/ckoorosh/RobuText。

关键词

引用

@article{arxiv.2304.02963,
  title  = {Benchmarking Robustness to Text-Guided Corruptions},
  author = {Mohammadreza Mofayezi and Yasamin Medghalchi},
  journal= {arXiv preprint arXiv:2304.02963},
  year   = {2023}
}

备注

Accepted to CVPRW 2023