用于立体图像超分辨率的混合Transformer与CNN注意力网络
计算机视觉与模式识别
2023-05-10 v1
摘要
多阶段策略常用于图像复原任务。尽管基于 transformer 的方法在单图像超分辨率任务中展现出高效率,但在立体超分辨率任务中尚未显示出相对于基于 CNN 方法的显著优势。这可归因于两个关键因素:首先,当前单图像超分辨率 transformer 无法在此过程中利用互补的立体信息;其次,transformer 的性能通常依赖于充足数据,而常见立体图像超分辨率算法中缺乏此类数据。为解决这些问题,我们提出混合 Transformer 与 CNN 注意力网络(HTCAN),其利用基于 transformer 的网络进行单图像增强,并采用基于 CNN 的网络进行立体信息融合。此外,我们采用多块训练策略和更大的窗口尺寸以激活更多输入像素用于超分辨率。我们还重新审视了其他先进技术,如数据增强、数据集成和模型集成,以减轻过拟合与数据偏差。最终,我们的方法取得 23.90dB 的分数,并成为 NTIRE 2023 立体图像超分辨率挑战赛 Track 1 的冠军。
引用
@article{arxiv.2305.05177,
title = {Hybrid Transformer and CNN Attention Network for Stereo Image Super-resolution},
author = {Ming Cheng and Haoyu Ma and Qiufang Ma and Xiaopeng Sun and Weiqi Li and Zhenyu Zhang and Xuhan Sheng and Shijie Zhao and Junlin Li and Li Zhang},
journal= {arXiv preprint arXiv:2305.05177},
year = {2023}
}
备注
10 pages, 3 figures, accepted by CVPR workshop 2023