中文

DExTeR:用于医学影像的类别与实例专家弱半监督目标检测

计算机视觉与模式识别 2026-01-21 v1

摘要

在医学影像中检测解剖标志对于诊断和干预引导至关重要。然而,目标检测模型依赖于成本高昂的边界框标注,限制了其可扩展性。基于点标注的弱半监督目标检测(Weakly Semi-Supervised Object Detection, WSSOD)提出用单个点标注每个实例,在保留定位信号的同时最大限度地减少标注时间。一个在少量带框标注子集上训练的点到框(Point-to-Box)教师模型,将这些点标注转换为伪框标签,用以训练学生检测器。然而,医学图像带来了独特的挑战,包括重叠的解剖结构、可变的目标尺寸以及难以辨识的结构,这些都阻碍了精确的边界框推断。为了克服这些挑战,我们提出了 DExTeR(DETR with Experts),一种专为医学影像定制的基于 Transformer 的点到框回归器。DExTeR 基于 Point-DETR 构建,将单点标注编码为目标查询,通过提出的类别引导可变形注意力(class-guided deformable attention)来优化特征提取,该注意力机制利用点坐标和类别标签引导注意力采样,以捕获类别特定特征。为了提高对复杂结构的辨别能力,它引入了 CLICK-MoE(类别、实例与通用知识混合专家),解耦类别和实例表示,以减少相邻或重叠实例之间的混淆。最后,我们实现了一种多点训练策略,该策略促进了不同点位置之间预测的一致性,提高了对标注变异性的鲁棒性。DExTeR 在跨越不同医学领域(内窥镜检查、胸部 X 光和超声内镜)的三个数据集上均达到了最先进的性能,突显了其在降低标注成本的同时保持高检测精度的潜力。

关键词

引用

@article{arxiv.2601.13954,
  title  = {DExTeR: Weakly Semi-Supervised Object Detection with Class and Instance Experts for Medical Imaging},
  author = {Adrien Meyer and Didier Mutter and Nicolas Padoy},
  journal= {arXiv preprint arXiv:2601.13954},
  year   = {2026}
}