HiP:分层感知器
计算机视觉与模式识别
2022-11-07 v2
摘要
诸如Perceiver之类的通用感知系统可处理任意模态的任意组合,并能够处理多达数十万输入。它们通过完全使用全局注意力操作实现了这种通用性。然而,这阻碍了它们扩展到处理原始高分辨率图像或视频所需的输入规模。本文中,我们展示了可将一定程度的局部性重新引入这些模型,在保持其通用性的同时极大提升效率。为进一步扩展,我们引入一种自监督方法,能够学习用于极大规模信号的稠密低维位置嵌入。我们将所得模型称为分层感知器(HiP)。综上,我们的贡献为:1)将Perceiver类模型扩展到原始高分辨率图像与音频+视频;2)展示利用掩码自编码从零学习1M+位置嵌入的可行性;3)在来自ImageNet、AudioSet、PASCAL VOC、ModelNet40与Kinetics数据集的原始数据上,使用完全相同且未改动的模型,无需专门预处理或任何分词,即展现出具有竞争力的性能。
引用
@article{arxiv.2202.10890,
title = {HiP: Hierarchical Perceiver},
author = {Joao Carreira and Skanda Koppula and Daniel Zoran and Adria Recasens and Catalin Ionescu and Olivier Henaff and Evan Shelhamer and Relja Arandjelovic and Matt Botvinick and Oriol Vinyals and Karen Simonyan and Andrew Zisserman and Andrew Jaegle},
journal= {arXiv preprint arXiv:2202.10890},
year = {2022}
}