Perceiver:基于迭代注意力的通用感知模型
计算机视觉与模式识别
2021-06-24 v2 人工智能
机器学习
声音
音频与语音处理
摘要
生物系统通过同时处理来自视觉、听觉、触觉、本体感觉等多种模态的高维输入来感知世界。而深度学习中使用的感知模型是为单一模态设计的,常依赖于领域特定的假设,例如几乎所有现有视觉模型所利用的局部网格结构。这些先验引入了有益的归纳偏置,但也使模型局限于单一模态。本文引入 Perceiver——一个基于 Transformer 构建的模型,因而对其输入之间的关系几乎不作架构假设,同时又能像 ConvNet 一样扩展到数十万个输入。该模型利用非对称注意力机制将输入迭代地提炼为一个紧凑的潜在瓶颈,从而能够扩展以处理极大规模的输入。我们表明,该架构在跨多种模态(图像、点云、音频、视频及视频+音频)的分类任务上与强大的专用模型相当或更优。Perceiver 在 ImageNet 上无需 2D 卷积、直接关注 50,000 个像素即取得与 ResNet-50 和 ViT 相当的性能,在 AudioSet 的各模态中也具竞争力。
引用
@article{arxiv.2103.03206,
title = {Perceiver: General Perception with Iterative Attention},
author = {Andrew Jaegle and Felix Gimeno and Andrew Brock and Andrew Zisserman and Oriol Vinyals and Joao Carreira},
journal= {arXiv preprint arXiv:2103.03206},
year = {2021}
}
备注
ICML 2021