微调视觉基础模型用于土木基础设施裂缝分割
计算机视觉与模式识别
2024-04-24 v3
摘要
大规模基础模型已成为主流深度学习方法,而在土木工程中,AI模型的规模受到严格限制。在这项工作中,引入了一种视觉基础模型用于裂缝分割。采用两种参数高效微调方法,适配器和低秩适应,对语义分割中的基础模型Segment Anything Model (SAM)进行微调。微调后的CrackSAM在不同场景和材料上表现出色。为了测试所提出方法的零样本性能,收集、标注并开源了两个与道路和外墙裂缝相关的独特数据集,共810张图像。与十二个成熟的语义分割模型进行了对比实验。在含有人工噪声的数据集和未见过的数据集上,CrackSAM的性能远远超过所有最先进的模型。CrackSAM表现出显著的优越性,特别是在昏暗光线、阴影、道路标线、施工缝等干扰因素下的挑战性条件下。这些跨场景结果展示了基础模型出色的零样本能力,并为土木工程中视觉模型的发展提供了新思路。
引用
@article{arxiv.2312.04233,
title = {Fine-tuning vision foundation model for crack segmentation in civil infrastructures},
author = {Kang Ge and Chen Wang and Yutao Guo and Yansong Tang and Zhenzhong Hu and Hongbing Chen},
journal= {arXiv preprint arXiv:2312.04233},
year = {2024}
}