中文

SwinVFTR:一种用于 3D OCT 液体分割的新型体素特征学习 Transformer

图像与视频处理 2025-01-06 v3 计算机视觉与模式识别

摘要

在 3D 光学相干断层扫描 (OCT) 图像中准确分割液体对眼病检测至关重要,但仍有挑战。传统基于自编码器的方法难以应对分辨率损失与信息恢复。尽管基于 transformer 的模型改善了分割,但它们并未针对 3D OCT 体数据优化,而后者因厂商与提取技术而异。为此,我们提出 SwinVFTR,一种用于 3D OCT 图像精确液体分割的 transformer 架构。SwinVFTR 采用通道级体素采样与移位窗口 transformer 块以改善液体定位。此外,一种新型体素注意力块增强了空间与深度方向注意力。使用多类 dice 损失训练,SwinVFTR 在 Spectralis、Cirrus 与 Topcon OCT 数据集上优于现有模型,分别取得 0.72、0.59 与 0.68 的平均 dice 分数,并在平均交并比 (IOU) 与结构相似性 (SSIM) 指标上表现更优。

关键词

引用

@article{arxiv.2303.09233,
  title  = {SwinVFTR: A Novel Volumetric Feature-learning Transformer for 3D OCT Fluid Segmentation},
  author = {Khondker Fariha Hossain and Sharif Amit Kamran and Alireza Tavakkoli and George Bebis and Sal Baker},
  journal= {arXiv preprint arXiv:2303.09233},
  year   = {2025}
}

备注

Accepted to IEEE International Symposium on Biomedical Imaging (ISBI 2025)