中文

用于遮挡图像分类的潜在增强自编码器

计算机视觉与模式识别 2024-02-13 v1

摘要

大面积遮挡会导致图像分类准确率显著下降。在推理过程中,各种类型的未见遮挡会向分类模型引入分布外数据,导致准确率降至50%以下。由于遮挡包含空间连接区域,涉及特征重建的传统方法不足以提升分类性能。我们引入了LEARN:潜在增强特征重建网络——一个基于自编码器的网络,可以在不修改分类模型权重的情况下,将其集成到分类模型的分类头之前。除了重建损失和分类损失,LEARN的训练有效地结合了在其潜在空间上计算的类内和类间损失——这有助于改善遮挡数据潜在空间的恢复,同时保留其类别特定的判别信息。在OccludedPASCAL3D+数据集上,所提出的LEARN大幅优于标准分类模型(VGG16和ResNet-50),并且比最先进的方法高出多达2%。在跨数据集测试中,我们的方法将平均分类准确率比最先进方法提高了5%以上。在每个实验中,我们的模型在分布内数据上始终保持着出色的准确率。

关键词

引用

@article{arxiv.2402.06936,
  title  = {Latent Enhancing AutoEncoder for Occluded Image Classification},
  author = {Ketan Kotwal and Tanay Deshmukh and Preeti Gopal},
  journal= {arXiv preprint arXiv:2402.06936},
  year   = {2024}
}