中文

可逆注意力

计算机视觉与模式识别 2021-06-29 v2

摘要

注意力机制已被证明是捕获长程依赖的有效机制。然而,迄今为止它尚未被部署在可逆网络中。这是因为要使网络可逆,网络中的每个组件都需要是双射变换,而普通的注意力块并非如此。在本文中,我们提出可逆注意力,可插入现有的可逆模型中。我们从数学上和实验上证明,通过仔细约束注意力模型的 Lipschitz 常数可以实现其可逆性。我们在图像重建任务上用 3 个流行数据集验证了可逆注意力的可逆性:CIFAR-10、SVHN 和 CelebA。我们还表明,在密集预测任务上,我们的可逆注意力与普通的不可逆注意力取得了相似的性能。代码可在 https://github.com/Schwartz-Zha/InvertibleAttention 获取。

关键词

引用

@article{arxiv.2106.09003,
  title  = {Invertible Attention},
  author = {Jiajun Zha and Yiran Zhong and Jing Zhang and Richard Hartley and Liang Zheng},
  journal= {arXiv preprint arXiv:2106.09003},
  year   = {2021}
}

备注

19 pages. The code is available at https://github.com/Schwartz-Zha/InvertibleAttention