用于结构构件与损伤像素级识别的高分辨率视觉Transformer
计算机视觉与模式识别
2023-08-08 v1 图像与视频处理
摘要
视觉检测主要用于评估土木结构的状态,但无人机(UAV)和人工智能的最新发展提高了检测过程的速度、安全性和可靠性。在本研究中,我们开发了一种基于视觉Transformer和拉普拉斯金字塔缩放网络的语义分割网络,用于高效解析高分辨率视觉检测图像。检测过程中收集的大量高分辨率图像会拖慢调查工作。尽管已有大量研究致力于使用深度学习模型进行损伤分割,但处理高分辨率视觉数据会带来重大的计算困难。传统上,图像被均匀下采样或分块以应对计算需求。然而,输入存在丢失局部精细细节(如细小裂缝)或全局上下文信息的风险。受超分辨率架构启发,我们的视觉Transformer模型学习对高分辨率图像和掩码进行缩放,以在不牺牲计算效率的前提下保留有价值的局部特征和全局语义。所提出的框架已通过使用多种像素级材料检测指标在桥梁检测报告图像数据集上的综合实验进行了评估。
引用
@article{arxiv.2308.03006,
title = {High-Resolution Vision Transformers for Pixel-Level Identification of Structural Components and Damage},
author = {Kareem Eltouny and Seyedomid Sajedi and Xiao Liang},
journal= {arXiv preprint arXiv:2308.03006},
year = {2023}
}