HiT:基于分层Transformer的建筑物制图
计算机视觉与模式识别
2024-01-11 v2
摘要
近年来,基于深度学习的方法已被广泛探索用于从高分辨率遥感影像中自动提取建筑物制图。尽管大多数建筑物制图模型为地理与制图系统生成建筑物矢量多边形,但主流方法通常将多边形建筑物提取分解为若干子问题,包括分割、多边形化和规则化,导致推理流程复杂、精度低且泛化能力差。本文提出一种简单新颖的基于分层Transformer的建筑物制图方法,称为HiT,以提升从高分辨率遥感影像中进行多边形建筑物制图的质量。HiT构建于两阶段检测架构之上,通过添加与分类头和边界框回归头并行的一个多边形头实现。HiT同时输出建筑物边界框与矢量多边形,是完全端到端可训练的。多边形头将建筑物多边形表示为具有双向特性的序列化顶点,这是一种简单优雅的多边形表示,避免了起止顶点假设。在这一新视角下,多边形头采用Transformer编码器-解码器架构,在所设计的双向多边形损失监督下预测序列化顶点。此外,在多边形头的编码器中引入了结合卷积操作的分层注意力机制,在顶点与边级别提供建筑物多边形更多的几何结构。在两个基准(CrowdAI与Inria数据集)上的综合实验表明,与最先进方法相比,我们的方法在实例分割与多边形度量上达到了新的state-of-the-art。此外,定性结果验证了我们的模型在复杂场景下的优越性与有效性。
引用
@article{arxiv.2309.09643,
title = {HiT: Building Mapping with Hierarchical Transformers},
author = {Mingming Zhang and Qingjie Liu and Yunhong Wang},
journal= {arXiv preprint arXiv:2309.09643},
year = {2024}
}
备注
Accepted to TGRS