SciLT:基于科学图像领域的长尾图像分类
计算机视觉与模式识别
2026-05-12 v2
摘要
长尾识别受益于基础模型和微调范式,但现有研究和基准主要局限于自然图像领域,其中预训练和微调数据共享相似的分布。相比之下,科学图像具有独特的视觉特征和监督信号,这引发了关于在此类设置下微调基础模型有效性的问题。本文我们在纯粹的视觉和微调范式下探讨科学长尾识别。在三个科学基准上进行实验表明,微调基础模型仅带来有限的提升,并发现中间层特征在尤其是尾部类别方面发挥重要作用。鼓励这一发现,我们提出 SciLT,一个通过自适应特征融合和双监督学习来利用多级表示的框架。通过同时利用中间层和最终层的特征,SciLT 在头类和尾部类别之间实现了均衡的性能。广泛的实验表明,SciLT 持续地优于现有方法,为科学长尾识别树立了强大且实用的基准,并为适应具有显着领域偏移的科学数据提供了宝贵的指导。
引用
@article{arxiv.2604.03687,
title = {SciLT: Long-tailed Image Classification under Scientific Image Domains},
author = {Jiahao Chen and Bing Su},
journal= {arXiv preprint arXiv:2604.03687},
year = {2026}
}