Transformer遇上视觉学习理解: 综述
计算机视觉与模式识别
2022-03-25 v1
摘要
动态注意力机制与全局建模能力使Transformer展现出强大的特征学习能力。近年来,Transformer在计算机视觉中已可与CNNs方法相媲美。本综述主要调研Transformer在图像与视频应用中的当前研究进展,对视觉学习理解中的Transformer进行了全面概述。首先,回顾了在Transformer中起重要作用的注意力机制。随后,介绍了视觉Transformer模型及各模块原理。第三,调研了现有基于Transformer的模型,并比较了它们在视觉学习理解应用中的性能。研究了计算机视觉的三个图像任务与两个视频任务。前者主要包括图像分类、目标检测与图像分割;后者包含目标跟踪与视频分类。在多个公开基准数据集上比较不同模型在各任务中的性能具有重要意义。最后,总结了十个普遍性问题,并给出了视觉Transformer的发展前景。
引用
@article{arxiv.2203.12944,
title = {Transformers Meet Visual Learning Understanding: A Comprehensive Review},
author = {Yuting Yang and Licheng Jiao and Xu Liu and Fang Liu and Shuyuan Yang and Zhixi Feng and Xu Tang},
journal= {arXiv preprint arXiv:2203.12944},
year = {2022}
}
备注
arXiv admin note: text overlap with arXiv:2010.11929, arXiv:1706.03762 by other authors