中文

基于令牌融合改进图像分类

计算机视觉与模式识别 2022-08-22 v1 人工智能

摘要

本文提出一种融合 CNN 与 transformer 结构以提升图像分类性能的方法。就 CNN 而言,可良好提取图像局部区域信息,但提取全局信息存在局限。另一方面,transformer 在相对全局提取上具有优势,但在局部特征值提取上需耗费大量内存。对于图像,先通过 CNN 转换为特征图,并将各特征图像素视为令牌(token)。同时,将图像划分为块区域,随后与将其视为令牌的 transformer 方法融合。针对具有两种不同特征的令牌融合,我们提出三种方法:(1)并行结构的晚期令牌融合,(2)早期令牌融合,(3)逐层令牌融合。在使用 ImageNet 1k 的实验中,所提方法展现出最佳分类性能。

关键词

引用

@article{arxiv.2208.09183,
  title  = {Improved Image Classification with Token Fusion},
  author = {Keong Hun Choi and Jin Woo Kim and Yao Wang and Jong Eun Ha},
  journal= {arXiv preprint arXiv:2208.09183},
  year   = {2022}
}