低秩持续金字塔视觉转换器:轻量化适配用于 CT 分割整体器官
计算机视觉与模式识别
2024-10-08 v1
摘要
深度分割网络在特定数据集上训练可实现高性能。然而在临床实践中,常希望预训练的分割模型能够动态扩展,以便在不获取之前训练数据集或不从头训练的情况下对新器官进行分割。这将确保更高效的模型开发和部署范式,考虑到患者隐私和数据存储问题。这种临床上更受青睐的过程可视为持续语义分割(CSS)问题。以往的 CSS 工作要么会出现灾难性遗忘,要么会导致不可负担的内存开销随模型扩展。本文提出一种基于轻量化低秩适应(LoRA)的全新持续整体器官分割模型。我们首先在初始任务上训练并冻结一个金字塔视觉转换器(PVT)基础分割模型,然后为每个新学习任务持续添加轻量化可训练 LoRA 参数。通过对架构修改的全面探索,我们识别出三些最重要的层(即 patch-embedding、注意力头和前馈层),这些层在适应新分割任务方面至关重要,同时保持大部分预训练参数固定。我们提出的模型能够在不发生灾难性遗忘的情况下持续分割新器官,同时保持低的参数增长率。经历持续训练和测试的模型覆盖总计 121 个器官的四个数据集,结果表明该模型实现了高分割准确率,接近 PVT 和 nnUNet 上限,显著优于其他基于正则化的 CSS 方法。与领先的基于架构的 CSS 方法相比,本模型在参数增长率方面具有显著优势,同时实现了相当的性能。
引用
@article{arxiv.2410.04689,
title = {Low-Rank Continual Pyramid Vision Transformer: Incrementally Segment Whole-Body Organs in CT with Light-Weighted Adaptation},
author = {Vince Zhu and Zhanghexuan Ji and Dazhou Guo and Puyang Wang and Yingda Xia and Le Lu and Xianghua Ye and Wei Zhu and Dakai Jin},
journal= {arXiv preprint arXiv:2410.04689},
year = {2024}
}
备注
Accepted by Medical Image Computing and Computer Assisted Intervention -- MICCAI 2024