数据点间的自注意力:超越深度学习中的单输入-输出对
机器学习
2022-02-02 v2 机器学习
摘要
我们挑战了大多数监督深度学习背后的一个常见假设:模型仅依赖于其参数和单个输入的特征进行预测。为此,我们引入了一种通用深度学习架构,它以整个数据集作为输入,而不是一次处理一个数据点。我们的方法使用自注意力来显式地推理数据点之间的关系,这可以被视为利用参数化注意力机制实现非参数模型。然而,与传统的非参数模型不同,我们让模型从数据中端到端地学习如何利用其他数据点进行预测。从经验上看,我们的模型解决了传统深度学习模型无法解决的跨数据点查找和复杂推理任务。我们在表格数据上展示了极具竞争力的结果,在 CIFAR-10 上给出了初步结果,并深入揭示了模型如何利用点之间的交互。
引用
@article{arxiv.2106.02584,
title = {Self-Attention Between Datapoints: Going Beyond Individual Input-Output Pairs in Deep Learning},
author = {Jannik Kossen and Neil Band and Clare Lyle and Aidan N. Gomez and Tom Rainforth and Yarin Gal},
journal= {arXiv preprint arXiv:2106.02584},
year = {2022}
}
备注
Accepted for publication at NeurIPS 2021. First two authors contributed equally