中文

B-Cos 对齐 Transformer 学习人类可解释特征

计算机视觉与模式识别 2024-01-19 v2

摘要

视觉 Transformer(Vision Transformers, ViTs)和 Swin Transformer(Swin)目前是计算病理学领域的最先进技术。然而,由于缺乏可解释性,领域专家仍不愿使用这些模型。这并不奇怪,因为关键决策需要透明且可理解。理解 Transformer 的最常见方法是可视化其注意力。然而,ViT 的注意力图通常是碎片化的,导致解释不尽人意。在此,我们引入一种名为 B-cos 视觉 Transformer(BvT)的新型架构,其设计旨在更具可解释性。它用 B-cos 变换替换所有线性变换,以促进权重-输入对齐。在一项盲法研究中,医学专家明确将 BvT 排在 ViT 之上,表明我们的网络更善于捕捉生物医学相关结构。这对于 B-cos Swin Transformer(Bwin)也同样成立。与 Swin Transformer 相比,它在两个公共数据集上甚至将 F1 分数提高了高达 4.7%。

关键词

引用

@article{arxiv.2401.08868,
  title  = {B-Cos Aligned Transformers Learn Human-Interpretable Features},
  author = {Manuel Tran and Amal Lahiani and Yashin Dicente Cid and Melanie Boxberg and Peter Lienemann and Christian Matek and Sophia J. Wagner and Fabian J. Theis and Eldad Klaiman and Tingying Peng},
  journal= {arXiv preprint arXiv:2401.08868},
  year   = {2024}
}

备注

Accepted at MICCAI 2023 (oral). Camera-ready available at https://doi.org/10.1007/978-3-031-43993-3_50