CLARiTy:用于胸片病理多标签分类和弱监督定位的视觉Transformer
机器学习
2025-12-19 v1
摘要
胸片(CXR)的解释面临着显著挑战,尤其是在实现准确的多标签病理分类和空间定位方面。这两种任务需要不同的标注细粒度,但常受限于区域级(稠密)标注的稀缺。我们引入 CLARiTy(Class Localizing and Attention Refining Image Transformer),一种基于视觉Transformer的模型,用于胸部病理的多标签分类和弱监督定位。CLARiTy 使用多个类别特定的 token 生成判别性注意力图,并通过显式解剖先验进行前景分割和背景抑制的 SegmentCAM 模块。它在来自 NIH ChestX-ray14 数据集的图像级标签上训练,并利用来自 ConvNeXtV2 教师的知识蒸馏以提高效率。在官方 NIH 数据划分上,CLARiTy-S-16-512(CLARiTy的一个配置)在 14 种病理上实现了具竞争力的分类性能,在 8 种病理上实现了最先进的弱监督定位性能,净增 50.7%。特别是对于小病理如结节和肿瘤,提升尤为显著。CLARiTy-S-16-224 的低分辨率变体在效率方面具有更高优势,同时显著超越基线,从而在资源受限的环境中具有潜在应用前景。消融研究确认了 SegmentCAM、DINO 预训练、正交类 token 损失和注意力池化的贡献。CLARiTy 超越了 CNN-ViT 混合模型,利用 ViT 自注意力捕获全局上下文和类别特定定位,通过卷积背景抑制实现精确、降噪的热力图。
引用
@article{arxiv.2512.16700,
title = {CLARiTy: A Vision Transformer for Multi-Label Classification and Weakly-Supervised Localization of Chest X-ray Pathologies},
author = {John M. Statheros and Hairong Wang and Richard Klein},
journal= {arXiv preprint arXiv:2512.16700},
year = {2025}
}
备注
23 pages, 11 figures, submitted to Medical Image Analysis