一种用于立体视频超分辨率的新数据集与Transformer
计算机视觉与模式识别
2022-04-22 v1
摘要
立体视频超分辨率(SVSR)旨在通过重建高分辨率视频来提升低分辨率视频的空间分辨率。SVSR的关键挑战在于保持立体一致性与时间一致性,否则观看者可能产生3D疲劳。已有若干立体图像超分辨率的显著工作,但针对立体视频超分辨率的研究很少。本文提出一种基于Transformer的SVSR新模型,即Trans-SVSR。Trans-SVSR包含两个关键新颖组件:一个时空卷积自注意力层和一个基于光流的前馈层,用于发现不同视频帧间的相关性并对齐特征。利用跨视角信息考虑显著视差的视差注意力机制(PAM)用于融合立体视图。由于缺乏适用于SVSR任务的基准数据集,我们收集了一个新的立体视频数据集SVSR-Set,包含使用专业立体相机拍摄的71段全高清(HD)立体视频。在收集的数据集及另外两个数据集上的大量实验表明,Trans-SVSR相比最先进方法具有竞争力的性能。项目代码与补充结果见 https://github.com/H-deep/Trans-SVSR/
引用
@article{arxiv.2204.10039,
title = {A New Dataset and Transformer for Stereoscopic Video Super-Resolution},
author = {Hassan Imani and Md Baharul Islam and Lai-Kuan Wong},
journal= {arXiv preprint arXiv:2204.10039},
year = {2022}
}
备注
Conference on Computer Vision and Pattern Recognition (CVPR 2022)