中文

魔鬼藏在均匀性之中:探索 Transformer 中多样化学习者

计算机视觉与模式识别 2025-03-27 v1

摘要

基于 Transformer 的方法在图像修复领域获得了广泛关注,其中核心组件即多头注意力 (Multi-Head Attention, MHA),在捕获多样化特征和恢复高质量结果方面发挥着关键作用。在 MHA 中,各注意力头独立地从均匀划分的子空间中进行注意力计算,导致冗余问题,阻碍模型实现令人满意的输出。本文提出通过探索多样化学习者并引入注意力头之间的各种相互作用来改进 MHA,构建了称为 HINT 的层次化多头注意力驱动 Transformer 模型用于图像修复。HINT 包含两个模块,即层次化多头注意力 (Hierarchical Multi-Head Attention, HMHA) 和查询-键缓存更新 (Query-Key Cache Updating, QKCU) 模块,以解决源自常规 MHA 的冗余问题。具体而言,HMHA 通过让注意力头学习不同大小子空间且包含不同信息来提取多样化的上下文特征。此外,QKCU 包括局部和跨层方案,进一步通过促进注意力头在层内及跨层之间的增强交互来降低冗余问题。我们在 12 个基准数据集上进行了大量实验,涵盖 5 项图像修复任务,包括低光增强、去雾、除雪、去噪和除雨,以展示 HINT 的优势。源码已包含在补充材料中。

关键词

引用

@article{arxiv.2503.20174,
  title  = {Devil is in the Uniformity: Exploring Diverse Learners within Transformer for Image Restoration},
  author = {Shihao Zhou and Dayu Li and Jinshan Pan and Juncheng Zhou and Jinglei Shi and Jufeng Yang},
  journal= {arXiv preprint arXiv:2503.20174},
  year   = {2025}
}

备注

11 pages, 10 figures