理解应用DETR于自然图像与医学图像的差异
计算机视觉与模式识别
2025-06-03 v2
摘要
基于Transformer的检测器在计算机视觉任务中表现出色,尤其是在自然图像任务上。这些模型以Deformable DETR为示例,通过针对自然场景典型特征所设计的复杂工程策略进行优化。然而,医学成像数据呈现出独特挑战,如极大图像尺寸、较少且较小的兴趣区域,以及仅通过细微差异即可区分的对象类别。本研究评估了这些基于Transformer的设计选择在应用于代表这些不同医学成像数据特征的筛查乳腺钼片数据集时的适用性。我们的分析表明,来自自然图像领域的常见设计选择,如复杂的编码器架构、多尺度特征融合、查询初始化和迭代边界框细化,均不会提高医学图像中的目标检测性能,甚至可能损害性能。相反,更简单更浅层的架构往往能够实现相同或更好的结果。这一发现表明,针对医学成像数据的Transformer模型需要重新评估标准实践, potentially 导致更高效和专业化的医疗诊断框架。
关键词
引用
@article{arxiv.2405.17677,
title = {Understanding differences in applying DETR to natural and medical images},
author = {Yanqi Xu and Yiqiu Shen and Carlos Fernandez-Granda and Laura Heacock and Krzysztof J. Geras},
journal= {arXiv preprint arXiv:2405.17677},
year = {2025}
}
备注
Accepted for publication at the Journal of Machine Learning for Biomedical Imaging (MELBA) https://melba-journal.org/2025:009