LViT:语言与视觉Transformer在医学图像分割中的结合
计算机视觉与模式识别
2023-06-28 v4
摘要
深度学习已广泛应用于医学图像分割及其他方面。然而,由于数据标注成本过高,获取充足高质量标注数据的困难限制了现有医学图像分割模型的性能。为缓解这一限制,我们提出了一种新的文本增强医学图像分割模型LViT(Language meets Vision Transformer,语言遇见视觉Transformer)。在我们的LViT模型中,引入医学文本标注以补偿图像数据中的质量缺陷。此外,文本信息可在半监督学习中引导生成质量更高的伪标签。我们还提出了指数伪标签迭代机制(EPI)以帮助像素级注意力模块(PLAM)在半监督LViT设置中保留局部图像特征。在我们的模型中,LV(语言-视觉)损失被设计用于直接利用文本信息监督未标注图像的训练。为进行评估,我们构建了三个包含X射线和CT图像的多模态医学分割数据集(图像+文本)。实验结果表明,我们提出的LViT在完全监督和半监督设置下均具有优越的分割性能。代码与数据集可在 https://github.com/HUANGLIZI/LViT 获取。
引用
@article{arxiv.2206.14718,
title = {LViT: Language meets Vision Transformer in Medical Image Segmentation},
author = {Zihan Li and Yunxiang Li and Qingde Li and Puyang Wang and Dazhou Guo and Le Lu and Dakai Jin and You Zhang and Qingqi Hong},
journal= {arXiv preprint arXiv:2206.14718},
year = {2023}
}
备注
Accepted by IEEE Transactions on Medical Imaging (TMI)