中文

一种用于生物医学图像分类的带自注意力残差连接的视觉Transformer

计算机视觉与模式识别 2025-10-23 v2

摘要

生物医学图像分类需要基于特定特征分布捕获生物信息。在此类多数应用中,主要挑战源于患病样本可用量有限以及数据集的不平衡性质。本文提出一种用于视觉Transformer(ViT)的多头自注意力新框架,其能够捕获用于分类与分析的特定图像特征。所提方法利用残差连接的概念,在多头注意力的每个块中累积最佳注意力输出。所提框架已在两个小型数据集上评估:(i)血细胞分类数据集与(ii)基于脑MRI图像的脑肿瘤检测。结果显示相较传统ViT及其他基于卷积的先进分类模型有显著改进。

关键词

引用

@article{arxiv.2306.01594,
  title  = {A Novel Vision Transformer with Residual in Self-attention for Biomedical Image Classification},
  author = {Arun K. Sharma and Nishchal K. Verma},
  journal= {arXiv preprint arXiv:2306.01594},
  year   = {2025}
}