中文

用于广义视觉识别的解耦 Mixup

计算机视觉与模式识别 2022-10-27 v1

摘要

当训练数据与测试数据来自同一分布时,卷积神经网络 (CNN) 展现出卓越的性能。然而,此类训练好的 CNN 模型在未见过的分布外 (OOD) 测试数据上往往大幅退化。为解决此问题,我们提出了一种新颖的“Decoupled-Mixup”方法来训练 CNN 模型,以用于 OOD 视觉识别。与以往将图像对同质结合的工作不同,我们的方法将每幅图像解耦为判别性区域和易噪区域,然后异质地结合这些图像对的区域来训练 CNN 模型。由于观察到纹理和杂乱背景等易噪区域在训练期间对 CNN 模型的泛化能力不利,我们在组合图像对时增强来自判别性区域的特征并抑制易噪区域的特征。为进一步提升训练模型的泛化能力,我们提出在基于频率和基于上下文的方式下解耦判别性区域和易噪区域。实验结果表明,我们的方法在由未见上下文组成的测试数据上具有很高的泛化性能,在 NICO Challenge 中,我们的方法在 Track-1 中取得了 85.76\% 的 top-1 准确率,在 Track-2 中取得了 79.92\% 的准确率。源代码可在 https://github.com/HaozheLiu-ST/NICOChallenge-OOD-Classification 获取。

关键词

引用

@article{arxiv.2210.14783,
  title  = {Decoupled Mixup for Generalized Visual Recognition},
  author = {Haozhe Liu and Wentian Zhang and Jinheng Xie and Haoqian Wu and Bing Li and Ziqi Zhang and Yuexiang Li and Yawen Huang and Bernard Ghanem and Yefeng Zheng},
  journal= {arXiv preprint arXiv:2210.14783},
  year   = {2022}
}

备注

Accepted by ECCV'2022 Workshop: Causality in Vision