Q-Former 自编码器:用于医学异常检测的现代化框架
计算机视觉与模式识别
2025-07-25 v1
摘要
医学图像异常检测是一项重要且具挑战性的任务,由于可能的异常类型多样且实际上不可能收集到全面标注的数据集。本文提出一种现代化的自编码器框架——Q-Former 自编码器,该框架利用诸如 DINO、DINOv2 和掩码自编码器(Masked Autoencoder)等领先的预训练视觉基础模型。我们不从头训练编码器,而是直接使用冻结的视觉基础模型作为特征提取器,从而无需针对特定领域进行微调即可获得丰富的、多阶段的、高级别表征。我们提出将 Q-Former 架构用作瓶颈,使能够控制重建序列的长度,同时高效地聚合多尺度特征。此外,我们引入了使用预训练掩码自编码器特征计算的感知损失,引导重建朝向语义意义的结构。该框架在四个多样化的医学异常检测基准数据集上进行评估,在 BraTS2021、RESC 和 RSNA 上实现了最先进的成绩。我们的结果表明,预训练于自然图像的视觉基础模型编码器能够有效地推广到医学图像分析任务,而无需进一步微调。我们将代码和模型发布于 https://github.com/emirhanbayar/QFAE。
引用
@article{arxiv.2507.18481,
title = {Q-Former Autoencoder: A Modern Framework for Medical Anomaly Detection},
author = {Francesco Dalmonte and Emirhan Bayar and Emre Akbas and Mariana-Iuliana Georgescu},
journal= {arXiv preprint arXiv:2507.18481},
year = {2025}
}
备注
15 pages