中文

MTVNet:使用Transformer进行体素映射——具有长程相互作用的超分辨率网络

计算机视觉与模式识别 2024-12-10 v2 图像与视频处理

摘要

到目前为止,体素超分辨率很难利用二维超分辨率中基于Transformer模型的最新进展。三维体素中自注意力所需的内存限制了感受野。因此,长程相互作用在三维中并未像在二维中那样得到充分利用,Transformer的优势也未得到体现。我们提出了一种基于多尺度Transformer的模型,该模型基于分层注意力块并结合多尺度的载体令牌来克服这一问题。在这里,来自粗分辨率较大区域的信息被顺序传递到更精细分辨率的区域,以预测超分辨率图像。通过在每种分辨率下使用Transformer层,我们的由粗到细建模限制了每个尺度的令牌数量,并实现了比以往更大区域的注意力。我们在五个三维数据集上实验性地将我们的方法MTVNet与最先进的体素超分辨率模型进行了比较,证明了增大感受野的优势。这种优势对于比常用三维数据集中的图像更大的图像尤为明显。我们的代码可在https://github.com/AugustHoeg/MTVNet获取。

关键词

引用

@article{arxiv.2412.03379,
  title  = {MTVNet: Mapping using Transformers for Volumes -- Network for Super-Resolution with Long-Range Interactions},
  author = {August Leander Høeg and Sophia W. Bardenfleth and Hans Martin Kjer and Tim B. Dyrby and Vedrana Andersen Dahl and Anders Dahl},
  journal= {arXiv preprint arXiv:2412.03379},
  year   = {2024}
}

备注

14 pages, 8 Figures with supplementary material