基于全局图像令牌的Transformer压缩感知
计算机视觉与模式识别
2022-12-06 v3 机器学习
图像与视频处理
摘要
与传统手工方法相比,卷积神经网络(CNN)在压缩感知(CS)中展现了卓越性能。然而,它们在泛化性、归纳偏置以及难以建模长距离关系方面存在普遍局限。Transformer神经网络(TNN)通过实现旨在捕捉输入间依赖的注意力机制克服了这些问题。但高分辨率任务通常要求视觉Transformer(ViT)将图像分解为基于块的令牌,使输入局限于固有的局部上下文。我们提出一种新颖的图像分解方法,自然地将图像嵌入为低分辨率输入。这些万花筒令牌(KD)以与基于块的方法相同的计算成本提供了全局注意力机制。为展示该进展,我们将知名CS-MRI神经网络中的CNN组件替换为TNN模块,并证明了KD带来的改进。我们还提出了图像令牌集成方法,可提升整体图像质量并减小模型规模。补充材料见:https://github.com/uqmarlonbran/TCS.git
引用
@article{arxiv.2203.12861,
title = {Transformer Compressed Sensing via Global Image Tokens},
author = {Marlon Bran Lorenzana and Craig Engstrom and Shekhar S. Chandra},
journal= {arXiv preprint arXiv:2203.12861},
year = {2022}
}
备注
4 Pages, 4 Figures, 2 Tables