利用 Transformer 发现空间关系以实现域泛化
计算机视觉与模式识别
2021-10-14 v2 人工智能
摘要
由于图像数据多样性的快速增长,域泛化问题近来受到更多关注。尽管域泛化是一个具有挑战性的问题,但得益于计算机视觉中 AI 技术的快速发展,它已取得巨大进展。这些先进算法大多基于卷积神经网络(CNN)的深度架构提出。然而,尽管 CNN 具有发现判别性特征的强大能力,由于其滤波器响应多为局部的,它们在建模图像中不同位置间的关系上表现不佳。由于这些局部与全局空间关系被用来区分所考虑的对象,它们在提升应对域差距的泛化能力中起着关键作用。为获取对象部件关系以获得更好的域泛化,本工作提出使用自注意力模型。然而,注意力模型是为序列提出的,并不擅长对二维图像进行判别特征提取。考虑到这一点,我们提出了一种混合架构来发现这些局部特征间的空间关系,并导出编码了判别性特征及其关系的复合表示,以改善域泛化。在三个知名基准上的评估展示了利用所提方法建模图像特征间关系的益处,并取得了最先进的域泛化性能。更具体地,所提算法在 PACS 与 Office-Home 数据库上分别超越最先进方法 2.2% 与 3.4%。
引用
@article{arxiv.2108.10046,
title = {Discovering Spatial Relationships by Transformers for Domain Generalization},
author = {Cuicui Kang and Karthik Nandakumar},
journal= {arXiv preprint arXiv:2108.10046},
year = {2021}
}