基于 Vision Transformer (ViT) 架构在不平衡数据集上的建筑材料分类
计算机视觉与模式识别
2022-09-07 v2
摘要
本研究提出了一种可靠的模型,用于以最高精度识别不同的建筑材料,其可作为自动化进度监测等广泛建筑应用的有利工具。在本研究中,使用了一种称为 Vision Transformer(ViT)的新型深度学习架构来检测和分类建筑材料。通过使用不同的图像数据集评估所采用方法的鲁棒性。为此,该模型在两个大型不平衡数据集(即 Construction Material Library(CML)和 Building Material Dataset(BMD))上进行了训练和测试。还通过合并 CML 和 BMD 生成了第三个数据集,以创建更不平衡的数据集并评估所采用方法的能力。所得结果显示,在三个不同数据集的每一材料类别的评估指标(如准确率、精确率、召回率和 f1-score)中均达到了 100% 的准确率。我们认为所提出的模型构成了一种用于检测和分类不同材料类型的鲁棒工具。迄今为止,已有若干研究尝试自动分类多种建筑材料,但仍存在一些误差。本研究将解决上述不足,并提出一种以更高精度检测材料类型的模型。所采用的模型还能够推广到不同数据集。
引用
@article{arxiv.2108.09527,
title = {Construction material classification on imbalanced datasets using Vision Transformer (ViT) architecture},
author = {Maryam Soleymani and Mahdi Bonyani and Hadi Mahami and Farnad Nasirzadeh},
journal= {arXiv preprint arXiv:2108.09527},
year = {2022}
}
备注
18 pages, 11 figures, 7 tables