基于视觉Transformer的曲面分析
计算机视觉与模式识别
2022-06-01 v1 机器学习
神经元与认知
摘要
卷积神经网络(CNNs)向非欧几里得几何的扩展已产生多种用于流形研究的框架。其中许多方法存在设计局限,导致对长程关联的建模不佳,因为将卷积推广到不规则曲面并非易事。视觉Transformer(ViTs)近期取得的state-of-the-art性能表明,一种实现自注意力的通用架构可以替代CNNs的局部特征学习操作。受注意力建模在计算机视觉中成功的启发,我们将ViTs扩展到曲面,通过将曲面学习任务重新表述为序列到序列问题,并提出一种针对曲面网格的分块机制。我们在发育中人脑连接组计划(dHCP)数据集的两个脑龄预测任务上验证了所提出的曲面视觉Transformer(SiT)的性能,并研究了预训练对模型性能的影响。实验表明,SiT优于许多曲面CNNs,同时显示出一些通用变换不变性的证据。代码见 https://github.com/metrics-lab/surface-vision-transformers
引用
@article{arxiv.2205.15836,
title = {Surface Analysis with Vision Transformers},
author = {Simon Dahan and Logan Z. J. Williams and Abdulah Fawaz and Daniel Rueckert and Emma C. Robinson},
journal= {arXiv preprint arXiv:2205.15836},
year = {2022}
}
备注
7 pages, 1 figure, accepted to Transformers for Vision (T4V) workshop at CVPR 2022. arXiv admin note: substantial text overlap with arXiv:2204.03408, arXiv:2203.16414