EncodeNet:基于熵驱动的通用转换自编码器提升 DNN 准确率的框架
计算机视觉与模式识别
2024-04-23 v1 人工智能
机器学习
摘要
图像分类是计算机视觉中的基础任务,提升 DNN 准确率而不增加模型规模或延迟仍是一个迫切关切。我们在此方面做出了几个进展,导致 EncodeNet 设计和训练框架的创新。首先,涉及转换自编码器,这是一种将图像转换为其类别易于分类图像的新方法。我们以前的工作将转换自编码器与简单分类器联合使用,仅在简单数据集(如 MNIST 和 FMNIST)上实现中等准确率。然而,在更复杂的数据集(如 CIFAR-10)上,转换自编码器具有较大的重构损失,导致不适用于提升 DNN 准确率。为解决这些限制,我们通过利用更广泛的 DNN 类别(即由特征提取层后跟分类层组成的网络)来泛化转换自编码器的设计。我们融合了通用的转换自编码器算法并引入类内聚类以识别代表性图像,从而实现优化的图像特征学习。接下来,我们展示了 EncodeNet 设计和训练框架的有效性,在保持整体模型规模的同时提高了经过训练的基线 DNN 的准确率。EncodeNet 的构建模块包括从我们泛化的转换自编码器中提取的训练编码器将知识传递给轻量级分类器网络——也从基线 DNN 中提取。我们的实验结果表明,EncodeNet 在 CIFAR-10 上将 VGG16 的准确率从 92.64% 提升至 94.05%,在 CIFAR-100 上将 ResNet20 的准确率从 74.56% 提升至 76.04%。它超过了依赖知识蒸馏和注意力机制的最先进技术,为规模相当的模型提供了更高的准确率。
引用
@article{arxiv.2404.13770,
title = {EncodeNet: A Framework for Boosting DNN Accuracy with Entropy-driven Generalized Converting Autoencoder},
author = {Hasanul Mahmud and Kevin Desai and Palden Lama and Sushil K. Prasad},
journal= {arXiv preprint arXiv:2404.13770},
year = {2024}
}
备注
15 pages