VidFace:一种用于非对齐微小快照视频人脸超分辨率的纯Transformer求解器
计算机视觉与模式识别
2021-06-01 v1
摘要
本文研究从多帧低分辨率(LR)视频快照幻构真实高分辨率(HR)人脸的任务。我们提出一种纯基于Transformer的模型,称为VidFace,以充分利用多张缩略图间的全范围时空信息与面部结构线索。具体而言,VidFace一次性处理多张快照,并整体利用空间与时间信息来探索所有帧间的人脸对齐,从而避免对齐误差的累积。此外,我们设计了一种循环位置嵌入模块,为Transformer注入人脸先验,不仅有效正则化对齐机制,还替代了令人头疼的预训练。最后,我们从公开的Voxceleb2基准构建了一个新的大规模视频人脸超分辨率数据集,对现有方法在处理非对齐微小人脸快照上提出挑战。据我们所知,我们是首个尝试开发专为基于视频的人脸超分辨率定制的统一Transformer求解器。在公开视频人脸基准上的大量实验表明,所提方法显著优于现有最优方法(SOTA)。
引用
@article{arxiv.2105.14954,
title = {VidFace: A Full-Transformer Solver for Video FaceHallucination with Unaligned Tiny Snapshots},
author = {Yuan Gan and Yawei Luo and Xin Yu and Bang Zhang and Yi Yang},
journal= {arXiv preprint arXiv:2105.14954},
year = {2021}
}