GVTNet:基于图神经网络的视觉Transformer用于人脸超分辨率
计算机视觉与模式识别
2025-02-19 v1
摘要
近期的人脸超分辨率研究已广泛采用Transformer架构。该方法将输入图像处理为多个小补丁。然而,由于人脸图像中不同 facial 组件之间存在强关联,当对低分辨率图像进行超分辨率处理时,现有算法无法很好地处理补丁之间的关系,导致超分辨率结果中的 facial 组件出现失真。为解决此问题,本文提出一种基于图神经网络的Transformer架构,称为图视觉Transformer网络(Graph Vision Transformer Network)。我们将每个补丁视为图节点,基于补丁间的信息建立邻接矩阵,从而实现补丁仅与相邻补丁进行交互,进一步处理 facial 组件的关系。定量和可视化实验均凸显了本算法在状态方法技术上的优势。通过详细比较,我们展示了本算法在超分辨率能力方面具有更先进的特性,尤其在增强 facial 组件方面表现更佳。 PyTorch代码已提供:https://github.com/continueyang/GVTNet
引用
@article{arxiv.2502.12570,
title = {GVTNet: Graph Vision Transformer For Face Super-Resolution},
author = {Chao Yang and Yong Fan and Cheng Lu and Minghao Yuan and Zhijing Yang},
journal= {arXiv preprint arXiv:2502.12570},
year = {2025}
}