通过层次监督扩展原语分割中的规模
计算机视觉与模式识别
2026-04-23 v2
摘要
原语学习(ICL)使医学图像分割模型能够从有限示例中适应新的解剖结构,减少临床标注负担。然而,标准ICL方法通常依赖稠密、全局跨注意力,随图像分辨率呈指数级增长。虽然最近方法引入了局部注意力机制,但往往缺乏对选择过程的显式监督,导致对非信息性区域的冗余计算。我们提出PatchICL,一种结合选择性图像分块与多级监督的层次框架。我们的方法学习主动识别并仅关注最具信息性的解剖区域。相对于采用全局注意力的强基线UniverSeg,PatchICL在512×512分辨率下计算减少44%,同时保持竞争的领域内CT分割精度。在35个域外数据集中涵盖多种成像模态,PatchICL在13个模态类别中6个类别上超越基线,特别在以局部病灶为主导的模态(如OCT和皮肤诊断)方面表现突出。训练和评估代码已公开于 https://github.com/tidiane-camaret/ic_segmentation。
引用
@article{arxiv.2604.12752,
title = {Scaling In-Context Segmentation with Hierarchical Supervision},
author = {T. Camaret Ndir and Marco Reisert and Robin T. Schirrmeister},
journal= {arXiv preprint arXiv:2604.12752},
year = {2026}
}