中文

抗风格迁移是否等同于全局形状偏置?度量网络对全局形状配置的敏感性

计算机视觉与模式识别 2024-03-01 v3

摘要

深度学习模型已知表现出强烈的纹理偏置,而人类倾向于严重依赖全局形状结构进行物体识别。当前评估模型全局形状偏置的基准是一组风格迁移图像,其假设抗风格迁移攻击与模型中全局结构敏感性的发展相关。本工作中,我们表明使用风格迁移图像训练的神经网络确实学会忽略风格,但其形状偏置主要源于局部细节。我们提供 \textbf{破坏结构测试台(Disrupted Structure Testbench, DiST)} 作为对全局结构敏感性的直接度量。我们的测试包含来自 ImageNet-1K 的 2400 张原始图像,每张均配有两张破坏原始图像全局形状但通过纹理合成程序保留其纹理的图像。我们发现 \textcolor{black}{(1) 在先前线索冲突数据集上表现良好的模型在提出的 DiST 中表现不佳;(2) 有监督训练的视觉 Transformer (ViT) 从位置嵌入中丢失其全局空间信息,导致在 DiST 上相较卷积神经网络(CNNs)无显著优势;而自监督学习方法,尤其是掩码自编码器,显著提升了 ViT 的全局结构敏感性。(3) 提升全局结构敏感性与抗风格迁移正交,表明全局形状结构与局部纹理细节之间并非非此即彼的关系。使用 DiST 图像与风格迁移图像训练是互补的,可结合共同训练网络以增强全局形状敏感性与局部特征的鲁棒性。} 我们的代码将托管于 github: https://github.com/leelabcnbc/DiST

关键词

引用

@article{arxiv.2310.07555,
  title  = {Does resistance to style-transfer equal Global Shape Bias? Measuring network sensitivity to global shape configuration},
  author = {Ziqi Wen and Tianqin Li and Zhi Jing and Tai Sing Lee},
  journal= {arXiv preprint arXiv:2310.07555},
  year   = {2024}
}