kMaX-DeepLab:k-means 掩码 Transformer
摘要
Transformer 在视觉任务中的兴起不仅推进了网络骨干设计,也开启了实现端到端图像识别(如目标检测与全景分割)的新篇章。源于自然语言处理(NLP)的 Transformer 架构由自注意力与交叉注意力组成,有效学习了序列中元素间的长程交互。然而,我们观察到大多数现有的基于 Transformer 的视觉模型只是从 NLP 借用思路,忽视了语言与图像之间的关键差异,尤其是空间展平像素特征的极长序列长度。这进而阻碍了像素特征与对象查询之间交叉注意力的学习。在本文中,我们重新思考像素与对象查询的关系,并提出将交叉注意力学习重新表述为一个聚类过程。受传统 k-means 聚类算法启发,我们开发了用于分割任务的 k-means Mask Xformer(kMaX-DeepLab),其不仅提升了当前最优水平,还具备简洁优雅的设计。结果表明,我们的 kMaX-DeepLab 在 COCO val 集上以 58.0% PQ、Cityscapes val 集上以 68.4% PQ、44.0% AP 和 83.5% mIoU,以及 ADE20K val 集上以 50.9% PQ 和 55.2% mIoU 取得了新的 SOTA 性能,且无需测试时增强或外部数据集。我们希望我们的工作能为设计面向视觉任务的 Transformer 提供些许启示。TensorFlow 代码与模型见 https://github.com/google-research/deeplab2,PyTorch 重实现见 https://github.com/bytedance/kmax-deeplab
引用
@article{arxiv.2207.04044,
title = {kMaX-DeepLab: k-means Mask Transformer},
author = {Qihang Yu and Huiyu Wang and Siyuan Qiao and Maxwell Collins and Yukun Zhu and Hartwig Adam and Alan Yuille and Liang-Chieh Chen},
journal= {arXiv preprint arXiv:2207.04044},
year = {2023}
}
备注
ECCV 2022. arXiv v2: add results on ADE20K. arXiv v3: fix appendix. v4: fix typo. v5: add PyTorch re-implementation. Codes and models are available at TensorFlow: https://github.com/google-research/deeplab2 PyTorch: https://github.com/bytedance/kmax-deeplab