中文

我为何坚信 TTA 不更好:测试时增强在医学图像分类中的负面影响

计算机视觉与模式识别 2026-04-14 v1 人工智能

摘要

测试时增强(TTA)——通过聚合多个增强副本的预测结果以提高分类准确率——被广泛认为在医学影像中效果显著,尤其在生产系统和竞赛解决方案中被常规采用。我们进行了一项系统实证研究,挑战了这一假设,基于 MedMNIST v2 三个基准数据集和四种覆盖参数规模三个数量级(21K 至 11M)的模型。我们的主要发现是,标准增强流程下的 TTA 在单次推理时始终会导致准确率下降,以 ResNet-18 在病理图像上最严重的下降达 31.6 个百分点为例。这一降级影响所有模型架构,包括卷积模型,且随增强视图数量的增加而恶化。唯一例外是 ResNet-18 在皮肤学图像上的情况,仅获 modest +1.6% 的提升。我们识别出增强输入与训练时输入之间分布迁移——由批量归一化统计量不匹配放大——为主要机制。我们的消融研究表明,增强策略至关重要:仅强度增强保留的性能优于几何变换,包含原始未增强图像可部分缓解但无法消除准确率下降。这些发现为实践者提供了警示:TTA 不应作为默认的事后改进措施,但必须在具体的模型-数据集组合上进行验证。

关键词

引用

@article{arxiv.2604.09697,
  title  = {I Can't Believe TTA Is Not Better: When Test-Time Augmentation Hurts Medical Image Classification},
  author = {Daniel Nobrega Medeiros},
  journal= {arXiv preprint arXiv:2604.09697},
  year   = {2026}
}

备注

9 pages, 7 figures, 2 tables