基于卷积神经网络与Transformer的艺术品识别融合模型
计算机视觉与模式识别
2025-02-28 v3
摘要
艺术品识别在文化遗产保护、艺术市场分析和历史研究等领域至关重要。随着深度学习的发展,卷积神经网络(CNN)和Transformer模型已成为图像分类的关键工具。虽然CNN擅长局部特征提取,但在全局上下文方面存在困难;而Transformer在捕捉全局依赖关系方面能力强,但在细粒度局部细节方面较弱。为应对这些挑战,本文提出了一种融合CNN和Transformer的艺术品识别融合模型。该模型首先利用CNN提取局部特征,然后利用Transformer捕捉全局上下文,再通过特征融合机制提升分类准确率。在中国画和油画数据集上的实验表明,融合模型优于单独的CNN和Transformer模型,分别将分类准确率提升了9.7%和7.1%,F1分数分别提升了0.06和0.05。结果证明了该模型的有效性以及未来改进的潜力,如多模态融合和架构优化。
引用
@article{arxiv.2502.18083,
title = {A Fusion Model for Artwork Identification Based on Convolutional Neural Networks and Transformers},
author = {Zhenyu Wang and Heng Song},
journal= {arXiv preprint arXiv:2502.18083},
year = {2025}
}