应用于高分辨率无人机图像的无监督语义分割以增强道路场景解析
计算机视觉与模式识别
2024-04-30 v2 机器学习
摘要
从无人机图像解析道路场景时存在两个挑战:高分辨率图像的处理复杂性以及传统监督深度学习方法训练稳健且准确模型所需的大量手动标注依赖。本文介绍一种新颖的无监督道路解析框架,利用视觉语言模型的最新进展和基本计算机视觉技术以应对这两个关键挑战。该方法首先使用视觉语言模型高效处理超高分辨率图像,以快速识别道路感兴趣区域。随后应用视觉基础模型SAM生成这些区域的掩码,无需类别信息。随后,自监督学习网络处理这些掩码区域,以提取特征表示,并通过无监督算法聚类,为每个特征簇分配唯一ID。将掩码区域与相应ID组合,可生成初始伪标签,启动道路语义分割的迭代自训练过程。值得注意的是,本方法在无任何手动标注的情况下即可实现开发数据集上89.96%的平均交并比(mIoU),凭借超越人工定义类别限制的强大灵活性,能够从数据集本身自主获取新类别的知识。
引用
@article{arxiv.2402.02985,
title = {Applying Unsupervised Semantic Segmentation to High-Resolution UAV Imagery for Enhanced Road Scene Parsing},
author = {Zihan Ma and Yongshang Li and Ronggui Ma and Chen Liang},
journal= {arXiv preprint arXiv:2402.02985},
year = {2024}
}