中文

基于行列分解查询的双展平Transformer用于语义分割

计算机视觉与模式识别 2022-01-25 v1 机器学习

摘要

对于语义分割等密集预测任务,获取具有长程依赖的高分辨率特征至关重要。为了从尺寸为 h×wh\times w 的低分辨率特征图生成尺寸为 H×WH\times W 的高分辨率输出(hwHWhw\ll HW),朴素的密集Transformer会产生 O(hwHW)\mathcal{O}(hwHW) 的难以承受的复杂度,限制了其在高分辨率密集预测上的应用。我们提出双展平Transformer(DFlatFormer),通过将复杂度降低至 O(hw(H+W))\mathcal{O}(hw(H+W))(比朴素密集Transformer小多个数量级)来实现高分辨率输出。我们提出分解查询,通过独立的Transformer可处理地检索行注意力和列注意力,并将其输出组合形成高分辨率密集特征图。为此,从编码器输入序列分别按行和按列展平,以在保留各自行列结构的同时与分解查询对齐。行Transformer与列Transformer也相互交互,通过行与列之间的空间交叉捕获它们的相互注意力。我们还提出通过高效分组与池化执行注意力,以进一步降低模型复杂度。在 ADE20K 和 Cityscapes 数据集上的大量实验证明了所提双展平Transformer架构具有更优的 mIoU。

关键词

引用

@article{arxiv.2201.09139,
  title  = {Dual-Flattening Transformers through Decomposed Row and Column Queries for Semantic Segmentation},
  author = {Ying Wang and Chiuman Ho and Wenju Xu and Ziwei Xuan and Xudong Liu and Guo-Jun Qi},
  journal= {arXiv preprint arXiv:2201.09139},
  year   = {2022}
}