中文

HartleyMHA:频域自注意力实现分辨率鲁棒且参数高效的 3D 图像分割

图像与视频处理 2023-10-10 v1 计算机视觉与模式识别

摘要

随着 Transformer 的引入,多种基于注意力的图像分割模型被提出并取得可喜结果。尽管自注意力能捕捉长程依赖,但其对图像尺寸具有二次复杂度,尤其在 3D 中。为避免训练时内存溢出错误,3D 分割通常需缩小输入尺寸,但当训练模型应用于原始图像尺寸时精度可能欠佳。为解决此局限,受傅里叶神经算子(FNO)启发,我们引入 HartleyMHA 模型,其通过高效自注意力对训练图像分辨率具有鲁棒性。FNO 是一种用于学习偏微分方程中函数间映射的深度学习框架,具有零样本超分辨率和全局感受野的良好特性。我们通过使用带共享参数的 Hartley 变换修改 FNO,将模型尺寸缩减数个数量级,这使我们能进一步在频域应用自注意力,以更高效率实现更具表达力的高阶特征组合。在 BraTS'19 数据集上测试时,它以少于其他测试模型 1% 的参数实现了优于它们的训练图像分辨率鲁棒性。

关键词

引用

@article{arxiv.2310.04466,
  title  = {HartleyMHA: Self-Attention in Frequency Domain for Resolution-Robust and Parameter-Efficient 3D Image Segmentation},
  author = {Ken C. L. Wong and Hongzhi Wang and Tanveer Syeda-Mahmood},
  journal= {arXiv preprint arXiv:2310.04466},
  year   = {2023}
}

备注

This paper was accepted by the International Conference on Medical Image Computing and Computer-Assisted Intervention (MICCAI 2023). arXiv admin note: text overlap with arXiv:2310.03872