中文

LT-ViT:一种用于多标签胸部X光分类的视觉Transformer

计算机视觉与模式识别 2023-11-14 v1 机器学习

摘要

视觉Transformer(ViTs)在医学影像任务中被广泛采用,已有一些工作致力于胸部X光(CXRs)的视觉-语言训练。然而,我们预期在使用ViTs对CXRs进行纯视觉训练方面仍存在改进潜力,即通过聚合多尺度信息,这已被证明对非Transformer网络有益。因此,我们开发了LT-ViT,一种利用图像token与代表标签的随机初始化辅助token之间组合注意力的Transformer。我们的实验表明,LT-ViT(1)在两个公开可用的CXR数据集上超越了使用纯ViTs的最先进性能,(2)可泛化到其他预训练方法,因而与模型初始化无关,(3)无需grad-cam及其变体即可实现模型可解释性。

关键词

引用

@article{arxiv.2311.07263,
  title  = {LT-ViT: A Vision Transformer for multi-label Chest X-ray classification},
  author = {Umar Marikkar and Sara Atito and Muhammad Awais and Adam Mahdi},
  journal= {arXiv preprint arXiv:2311.07263},
  year   = {2023}
}

备注

5 pages, 2 figures