中文

用于建筑物损毁评估的双任务孪生 Transformer 框架

计算机视觉与模式识别 2022-05-31 v2 机器学习 图像与视频处理

摘要

关于建筑物损毁程度的准确且精细的信息对于人道主义救援和灾害响应至关重要。然而,作为遥感解译任务中最常用的架构,卷积神经网络(CNN)在建模像素间非局部关系方面能力有限。近来,最初为自然语言处理中长程依赖建模而提出的 Transformer 架构在计算机视觉任务中展现出有前景的结果。考虑到 Transformer 架构在计算机视觉领域的前沿进展,本文首次尝试设计一种基于 Transformer 的损毁评估架构(DamFormer)。在 DamFormer 中,首先构建孪生 Transformer 编码器,从输入的多时相图像对中抽取非局部且具有代表性的深度特征;随后设计多时相融合模块以融合信息供下游任务使用;最后,轻量级双任务解码器聚合多层次特征以得到最终预测。据我们所知,这是首次提出这样一种基于深度 Transformer 的网络用于多时相遥感解译任务。在大规模损毁评估数据集 xBD 上的实验结果展示了基于 Transformer 架构的潜力。

关键词

引用

@article{arxiv.2201.10953,
  title  = {Dual-Tasks Siamese Transformer Framework for Building Damage Assessment},
  author = {Hongruixuan Chen and Edoardo Nemni and Sofia Vallecorsa and Xi Li and Chen Wu and Lars Bromley},
  journal= {arXiv preprint arXiv:2201.10953},
  year   = {2022}
}

备注

IGARSS 2022