面向脑疾病的机器学习:Transformer 与视觉 Transformer
计算机视觉与模式识别
2023-03-22 v1
摘要
Transformer 最初是为自然语言处理(NLP)任务引入的,但很快被大多数深度学习领域(包括计算机视觉)所采用。它们度量成对输入 token(文本串中的词、视觉 Transformer 中的图像块)之间的关系,称为注意力。其代价随 token 数量呈指数增长。对于图像分类,最常见的 Transformer 架构仅使用 Transformer 编码器来变换各种输入 token。然而,也有大量其他应用使用了传统 Transformer 架构中的解码器部分。在此,我们首先介绍注意力机制(第 1 节),然后介绍包含视觉 Transformer 的基本 Transformer 模块(第 2 节)。接下来,我们讨论视觉 Transformer 针对小数据集或低计算量的若干改进(第 3 节)。最后,我们介绍应用于图像分类以外任务的视觉 Transformer,如检测、分割、生成和无标签训练(第 4 节),以及其他领域,如利用文本或音频数据的视频或多模态(第 5 节)。
引用
@article{arxiv.2303.12068,
title = {Machine Learning for Brain Disorders: Transformers and Visual Transformers},
author = {Robin Courant and Maika Edberg and Nicolas Dufour and Vicky Kalogeiton},
journal= {arXiv preprint arXiv:2303.12068},
year = {2023}
}
备注
To appear in O. Colliot (Ed.), Machine Learning for Brain Disorders, Springer