基于令牌融合改进图像分类
计算机视觉与模式识别
2022-08-22 v1 人工智能
摘要
本文提出一种融合 CNN 与 transformer 结构以提升图像分类性能的方法。就 CNN 而言,可良好提取图像局部区域信息,但提取全局信息存在局限。另一方面,transformer 在相对全局提取上具有优势,但在局部特征值提取上需耗费大量内存。对于图像,先通过 CNN 转换为特征图,并将各特征图像素视为令牌(token)。同时,将图像划分为块区域,随后与将其视为令牌的 transformer 方法融合。针对具有两种不同特征的令牌融合,我们提出三种方法:(1)并行结构的晚期令牌融合,(2)早期令牌融合,(3)逐层令牌融合。在使用 ImageNet 1k 的实验中,所提方法展现出最佳分类性能。
引用
@article{arxiv.2208.09183,
title = {Improved Image Classification with Token Fusion},
author = {Keong Hun Choi and Jin Woo Kim and Yao Wang and Jong Eun Ha},
journal= {arXiv preprint arXiv:2208.09183},
year = {2022}
}