中文

基于全局图像令牌的Transformer压缩感知

计算机视觉与模式识别 2022-12-06 v3 机器学习 图像与视频处理

摘要

与传统手工方法相比,卷积神经网络(CNN)在压缩感知(CS)中展现了卓越性能。然而,它们在泛化性、归纳偏置以及难以建模长距离关系方面存在普遍局限。Transformer神经网络(TNN)通过实现旨在捕捉输入间依赖的注意力机制克服了这些问题。但高分辨率任务通常要求视觉Transformer(ViT)将图像分解为基于块的令牌,使输入局限于固有的局部上下文。我们提出一种新颖的图像分解方法,自然地将图像嵌入为低分辨率输入。这些万花筒令牌(KD)以与基于块的方法相同的计算成本提供了全局注意力机制。为展示该进展,我们将知名CS-MRI神经网络中的CNN组件替换为TNN模块,并证明了KD带来的改进。我们还提出了图像令牌集成方法,可提升整体图像质量并减小模型规模。补充材料见:https://github.com/uqmarlonbran/TCS.git

关键词

引用

@article{arxiv.2203.12861,
  title  = {Transformer Compressed Sensing via Global Image Tokens},
  author = {Marlon Bran Lorenzana and Craig Engstrom and Shekhar S. Chandra},
  journal= {arXiv preprint arXiv:2203.12861},
  year   = {2022}
}

备注

4 Pages, 4 Figures, 2 Tables