分辨率缩放决定胸片分类中 DINOv3 迁移性能
计算机视觉与模式识别
2026-04-28 v3 人工智能
机器学习
摘要
自监督学习 (SSL) 已改进视觉表征学习,但其在胸片图像中的价值尚不明确。DINOv3 通过 Gram 锚定自蒸馏和显式高分辨率适应扩展了前任 SSL 模型。是否这些变化改善了胸片分类的迁移学习尚未确定。我们对 DINOv3 与 DINOv2 以及监督 ImageNet 初始化进行了基准测试,涵盖七个胸片数据集,包含 816,183 张来自儿童和成人队列的胸片图像。评估了 ViT-B/16 和 ConvNeXt-B 在 224 和 512 像素下的全参数微调,以及针对三个队列的 1024 实验。额外分析包括参数高效适应、合成标签损坏、外部验证、冻结 7B 特征和计算效率。主要结果是平均 AUROC。在成人队列中,DINOv3 在 224 x 224 像素下未显著优于 DINOv2,但在 512 x 512 像素下成为最强的初始化,尤其是针对 ConvNeXt-B。收益最大化于小范围和边界相关异常,尽管大结构发现几乎未变。儿童队列显示,DINOv3、高分辨率或 backbone 选择均未提供显著优势。扩大到 1024 x 1024 像素很少提升性能,却显著增加了计算成本。在全参数和参数高效适应下,ConvNeXt-B 仍优于 ViT-B/16。外部验证保留了 512 x 512 DINOv3 的优势,而合成标签损坏表明,这一优势不应简单解释为更好的噪声鲁棒性。对于胸片分类,DINOv3 在 512 x 512 像素下提供最可靠的益处,尤其是针对 ConvNeXt-B。完全适应的中等规模模型在 512 x 512 像素下的性能-成本权衡在本基准测试中最为理想。
引用
@article{arxiv.2510.07191,
title = {Resolution scaling governs DINOv3 transfer performance in chest radiograph classification},
author = {Soroosh Tayebi Arasteh and Mina Shaigan and Christiane Kuhl and Jakob Nikolas Kather and Sven Nebelung and Daniel Truhn},
journal= {arXiv preprint arXiv:2510.07191},
year = {2026}
}