AgMTR:面向遥感小样本分割的智能体挖掘Transformer
计算机视觉与模式识别
2024-09-27 v1
摘要
小样本分割(Few-shot Segmentation, FSS)旨在仅利用少量标注样本(即支持图像)来分割查询图像中的感兴趣对象。以往的方法通常利用支持-查询像素对之间的相似性来构建像素级语义关联。然而,在具有极端类内变化和杂乱背景的遥感场景中,这种像素级关联可能会产生大量错配,导致查询前景(FG)和背景(BG)像素之间的语义模糊。为解决此问题,我们提出了一种新颖的智能体挖掘Transformer(Agent Mining Transformer, AgMTR),它能自适应地挖掘一组局部感知的智能体来构建智能体级语义关联。与像素级语义相比,所给定的智能体具备局部上下文信息并拥有更广的感受野。此时,不同的查询像素可以选择性地聚合不同智能体的细粒度局部语义,从而增强查询前景与背景像素之间的语义清晰度。具体而言,首先提出了智能体学习编码器(Agent Learning Encoder, ALE)来建立最优传输方案,安排不同的智能体在不同局部区域下聚合支持语义。然后,为进一步优化智能体,构建了智能体聚合解码器(Agent Aggregation Decoder, AAD)和语义对齐解码器(Semantic Alignment Decoder, SAD),分别从无标签数据源和查询图像本身中突破有限的支持集,挖掘有价值的类别特定语义。在遥感基准数据集iSAID上的大量实验表明,所提出的方法达到了最先进的性能。令人惊讶的是,当扩展到更常见的自然场景(即PASCAL-5i和COCO-20i)时,我们的方法仍然具有很强的竞争力。
引用
@article{arxiv.2409.17453,
title = {AgMTR: Agent Mining Transformer for Few-shot Segmentation in Remote Sensing},
author = {Hanbo Bi and Yingchao Feng and Yongqiang Mao and Jianning Pei and Wenhui Diao and Hongqi Wang and Xian Sun},
journal= {arXiv preprint arXiv:2409.17453},
year = {2024}
}
备注
accepted to IJCV