用于Fashion MNIST分类的卷积神经网络与视觉Transformer:文献综述
计算机视觉与模式识别
2024-06-06 v1 机器学习
摘要
我们的综述探讨了卷积神经网络(CNN)与视觉Transformer(ViT)在图像分类领域的比较分析,特别聚焦于电子商务领域的服装分类。利用Fashion MNIST数据集,我们深入研究了CNN和ViT的独特属性。尽管CNN长期以来一直是图像分类的基石,但ViT引入了一种创新的自注意力机制,能够对不同输入数据成分进行精细加权。历史上,Transformer主要与自然语言处理(NLP)任务相关联。通过对现有文献的全面审视,我们旨在揭示ViT与CNN在图像分类背景下的差异。我们的分析细致地审视了采用这两种架构的最新方法,力求找出影响其性能的因素。这些因素包括数据集特征、图像尺寸、目标类别数量、硬件基础设施以及具体架构及其各自的最佳结果。我们的关键目标是确定在电子商务行业中,针对Fashion MNIST数据集图像分类,ViT与CNN之间最合适的架构,同时考虑特定条件和需求。我们强调了将这两种架构以不同形式结合以提升整体性能的重要性。通过联合这些架构,我们可以利用它们各自的独特优势,这可能为电子商务应用带来更精确、更可靠的模型。CNN擅长识别局部模式,而ViT则有效把握全局上下文,因此它们的结合是提升图像分类性能的一种有前景的策略。
引用
@article{arxiv.2406.03478,
title = {Convolutional Neural Networks and Vision Transformers for Fashion MNIST Classification: A Literature Review},
author = {Sonia Bbouzidi and Ghazala Hcini and Imen Jdey and Fadoua Drira},
journal= {arXiv preprint arXiv:2406.03478},
year = {2024}
}