中文

多尺度曲面视觉 Transformer

图像与视频处理 2024-06-12 v3 计算机视觉与模式识别 神经元与认知

摘要

曲面网格是表示人脑皮层结构与功能信息的优选域,但其复杂拓扑与几何给深度学习分析带来显著挑战。尽管 Transformer 作为序列到序列学习的域无关架构表现出色,自注意力操作的二次方代价仍是许多密集预测任务的障碍。受视觉 Transformer 分层建模最新进展启发,我们引入多尺度曲面视觉 Transformer (MS-SiT) 作为曲面深度学习的骨干架构。自注意力机制在局部网格窗口内应用,以实现底层数据的高分辨率采样,而偏移窗口策略改善了窗口间信息分享。相邻块被依次合并,使 MS-SiT 能学习适用于任意预测任务的分层表示。结果表明,在使用 Developing Human Connectome Project (dHCP) 数据集的新生儿表型预测任务中,MS-SiT 优于现有曲面深度学习方法。此外,将 MS-SiT 骨干构建为 U 形架构用于曲面分割,在使用 UK Biobank (UKB) 和人工标注 MindBoggle 数据集的皮层分区上展示了具竞争力的结果。代码与训练模型公开于 https://github.com/metrics-lab/surface-vision-transformers。

关键词

引用

@article{arxiv.2303.11909,
  title  = {The Multiscale Surface Vision Transformer},
  author = {Simon Dahan and Logan Z. J. Williams and Daniel Rueckert and Emma C. Robinson},
  journal= {arXiv preprint arXiv:2303.11909},
  year   = {2024}
}

备注

Accepted for publication at MIDL 2024, 17 pages, 6 figures