中文

基于视觉 Transformer 双向编码器表示的域泛化

计算机视觉与模式识别 2023-09-06 v1 机器学习

摘要

域泛化涉及将源域的知识汇聚到单一模型中,使其能泛化到未见的目标域。近期域泛化研究在使用深度学习模型时面临挑战,因为它们所交互的数据分布与训练时不同。在此,我们使用视觉 Transformer 对分布外(OOD)视觉基准进行域泛化。最初我们在分布外数据上考察了四种视觉 Transformer 架构,即 ViT、LeViT、DeiT 和 BEIT。由于图像 Transformer 的双向编码器表示(BEIT)架构表现最佳,我们将其用于 PACS、Home-Office 和 DomainNet 三个基准的进一步实验。我们的结果显示验证和测试准确率显著提升,且我们的实现显著克服了分布内与 OOD 数据之间的差距。

关键词

引用

@article{arxiv.2307.08117,
  title  = {Domain Generalisation with Bidirectional Encoder Representations from Vision Transformers},
  author = {Hamza Riaz and Alan F. Smeaton},
  journal= {arXiv preprint arXiv:2307.08117},
  year   = {2023}
}

备注

4 pages, accepted at the Irish Machine Vision and Image Processing Conference (IMVIP), Galway, August 2023