关注关键区域:利用视觉基础模型进行乳腺癌分类
计算机视觉与模式识别
2026-04-22 v1
摘要
视觉Transformer (ViT) 已成为许多计算机视觉任务的首选架构,但在计算机辅助诊断中的表现仍有限。本文聚焦乳腺癌影像检测,识别了两大挑战:其一,医学图像高分辨率且异常区域较小,导致token数量过多,softmax注意力机制难以局部化并关注相关区域;其二,医学图像分类属于细粒度任务,类内变异大、类间差异小,标准交叉熵训练不足。为克服此困难,我们提出三组件框架:(1) 基于感兴趣区域 (RoI) 的token降采样,通过目标检测模型引导注意力;(2) 在所选RoI之间进行对比学习,通过基于硬负样本的训练增强细粒度区分度;(3) 使用预训练的DINOv2 ViT,捕获具有局部分辨和细粒度特征的表示,而非全局CLIP表示。在公开乳腺影像数据集上实验表明,我们的方法在现有基线上取得优异性能,证明其有效性及在大规模乳腺癌筛查中的潜在临床应用。我们的代码已公开:https://aih-iitd.github.io/publications/attend-what-matters
引用
@article{arxiv.2604.19350,
title = {Attend what matters: Leveraging vision foundational models for breast cancer classification using mammograms},
author = {Samyak Sanghvi and Piyush Miglani and Sarvesh Shashikumar and Kaustubh R Borgavi and Veenu Singla and Chetan Arora},
journal= {arXiv preprint arXiv:2604.19350},
year = {2026}
}