中文

视觉 Transformer 向非自然图像域的迁移能力如何?一项涉及艺术分类的实证研究

计算机视觉与模式识别 2022-08-10 v1

摘要

在处理高维且空间结构化输入(如图像)的问题时,视觉 Transformer(VTs)正成为卷积神经网络(CNNs)的重要替代方案。然而,它们的迁移学习(TL)特性尚缺乏充分研究,且这些神经架构是否能像 CNNs 一样跨域迁移仍不完全清楚。本文研究在流行 ImageNet 数据集上预训练的 VTs 所学表征是否可迁移至非自然图像域。为此,我们考虑三个被广泛研究的艺术分类问题,并将其作为研究四种流行 VTs 之 TL 潜力的替代任务。在多项 TL 实验中,将其性能与四种常见 CNNs 进行了广泛比较。结果表明,VTs 展现出强大的泛化特性,且这些网络是比 CNNs 更强的特征提取器。

关键词

引用

@article{arxiv.2208.04693,
  title  = {How Well Do Vision Transformers (VTs) Transfer To The Non-Natural Image Domain? An Empirical Study Involving Art Classification},
  author = {Vincent Tonkes and Matthia Sabatelli},
  journal= {arXiv preprint arXiv:2208.04693},
  year   = {2022}
}