XCiT:交叉协方差图像 Transformer
计算机视觉与模式识别
2021-06-21 v2 机器学习
摘要
继在自然语言处理中取得成功之后,transformer 近期在计算机视觉中展现出很大潜力。transformer 底层的自注意力操作产生所有词元(即词语或图像块)之间的全局交互,并实现对图像数据超越卷积局部交互的灵活建模。然而,这种灵活性伴随着时间与内存的二次复杂度,阻碍了其在长序列与高分辨率图像上的应用。我们提出一种“转置”版自注意力,跨特征通道而非词元操作,其交互基于键与查询之间的交叉协方差矩阵。所得交叉协方差注意力(XCA)在词元数量上具线性复杂度,并允许高效处理高分辨率图像。我们的交叉协方差图像 transformer(XCiT)构建于 XCA 之上,将传统 transformer 的准确性与卷积架构的可扩展性相结合。我们通过在多个视觉基准上报告优异结果来验证 XCiT 的有效性与通用性,包括 ImageNet-1k 上的图像分类与自监督特征学习、COCO 上的目标检测与实例分割,以及 ADE20k 上的语义分割。
引用
@article{arxiv.2106.09681,
title = {XCiT: Cross-Covariance Image Transformers},
author = {Alaaeldin El-Nouby and Hugo Touvron and Mathilde Caron and Piotr Bojanowski and Matthijs Douze and Armand Joulin and Ivan Laptev and Natalia Neverova and Gabriel Synnaeve and Jakob Verbeek and Hervé Jegou},
journal= {arXiv preprint arXiv:2106.09681},
year = {2021}
}