中文

用于图像分类的多尺度统一网络

计算机视觉与模式识别 2024-03-28 v1

摘要

卷积神经网络(CNN)在视觉表示学习与识别方面取得了显著进展。然而,在处理现实世界的多尺度图像输入时,它们在性能和计算效率方面面临显著挑战。传统方法将所有输入图像重新缩放为固定大小,其中较大的固定尺寸有利于性能,但将小尺寸图像重新缩放为更大尺寸会引入数字化噪声并增加计算成本。在这项工作中,基于中心核对齐(CKA)分析,我们对 CNN 模型响应尺度变化的行为进行了全面的逐层研究。观察结果表明,与高层相比,低层对输入图像尺度变化更为敏感。受此启发,我们提出了多尺度统一网络(MUSN),由多尺度子网、统一网络和尺度不变约束组成。我们的方法将浅层划分为多尺度子网,以实现从多尺度输入中提取特征,并在深层统一低级特征以提取高级语义特征。施加尺度不变约束以保持不同尺度间的特征一致性。在 ImageNet 和其他尺度多样化数据集上的大量实验表明,MSUN 在模型性能和计算效率上均取得了显著提升。特别是,在多尺度场景下,MSUN 的准确率最高提升 44.53%,并将 FLOPs 减少 7.01-16.13%。

关键词

引用

@article{arxiv.2403.18294,
  title  = {Multi-scale Unified Network for Image Classification},
  author = {Wenzhuo Liu and Fei Zhu and Cheng-Lin Liu},
  journal= {arXiv preprint arXiv:2403.18294},
  year   = {2024}
}