MDViT:面向小规模医学图像分割数据集的多域视觉Transformer
计算机视觉与模式识别
2024-06-10 v3
摘要
尽管具有临床效用,医学图像分割(MIS)因其图像固有的复杂性与变异性仍是一项艰巨任务。视觉Transformer(ViTs)近期成为改善 MIS 的有前景方案;然而,其所需训练数据集大于卷积神经网络。为克服该障碍,已有数据高效 ViTs 被提出,但它们通常仅使用单一数据源训练,忽视了可从其他可用数据集利用的宝贵知识。朴素地合并不同域的数据集会导致负知识迁移(NKT),即由于不可忽略的域间异质性,某些域上的模型性能下降。本文中,我们提出 MDViT,首个多域 ViT,其包含域适配器,通过自适应利用多个小数据资源(域)中的知识来缓解数据饥渴并对抗 NKT。进一步,为增强跨域表示学习,我们整合了互知识蒸馏范式,在通用网络(覆盖所有域)与辅助域特定分支间迁移知识。在 4 个皮肤病变分割数据集上的实验表明,MDViT 优于最先进算法,具有优越的分割性能和固定的模型规模,且在推理时即使加入更多域也保持该特性。我们的代码见 https://github.com/siyi-wind/MDViT。
引用
@article{arxiv.2307.02100,
title = {MDViT: Multi-domain Vision Transformer for Small Medical Image Segmentation Datasets},
author = {Siyi Du and Nourhan Bayasi and Ghassan Hamarneh and Rafeef Garbi},
journal= {arXiv preprint arXiv:2307.02100},
year = {2024}
}
备注
10 pages, 2 figures, accepted by 26th International Conference on Medical Image Computing and Computer Assisted Intervention (MICCAI 2023)