中文

面向人脸超分辨率的注意力引导多尺度交互网络

计算机视觉与模式识别 2025-09-12 v4

摘要

近年来,CNN和Transformer混合网络在人脸超分辨率(FSR)任务中表现出卓越的性能。由于混合网络中存在大量不同尺度的特征,如何融合这些多尺度特征并促进其互补性对于增强FSR至关重要。然而,现有的基于混合网络的FSR方法忽略了这一点,只是简单地将Transformer和CNN组合在一起。为解决这个问题,我们提出了一种注意力引导的多尺度交互网络(AMINet),它融合了局部和全局特征交互以及编码器-解码器阶段的特征交互。具体来说,我们提出了一个局部和全局特征交互模块(LGFI),以促进全局特征与我们的残差深度特征提取模块(RDFE)从不同感受野提取的局部特征的融合。此外,我们提出了一个选择性核注意力融合模块(SKAF),以在LGFI内部以及编码器-解码器阶段自适应地选择不同特征的融合方式。我们的上述设计允许多尺度特征在模块内部以及编码器和解码器之间自由流动,这可以促进不同尺度特征的互补性以增强FSR。全面的实验证实,我们的方法在计算消耗更少、推理速度更快的情况下,始终表现良好。

关键词

引用

@article{arxiv.2409.00591,
  title  = {Attention-Guided Multi-scale Interaction Network for Face Super-Resolution},
  author = {Xujie Wan and Wenjie Li and Guangwei Gao and Huimin Lu and Jian Yang and Chia-Wen Lin},
  journal= {arXiv preprint arXiv:2409.00591},
  year   = {2025}
}

备注

accepted by IEEE Transactions on Systems, Man and Cybernetics:Systems (TSMC)