中文

级联多尺度注意力机制:增强低分辨率图像的多尺度特征提取与交互

计算机视觉与模式识别 2025-08-25 v3

摘要

在图像识别任务的实际应用中,例如人体姿态估计,相机经常捕捉到低分辨率的目标,如人体。这种情况对提取和利用多尺度特征构成了挑战,而多尺度特征对于精确推理通常至关重要。为了应对这一挑战,我们提出了一种新的注意力机制,名为级联多尺度注意力(CMSA),专为CNN-ViT混合架构设计,以有效处理低分辨率输入。CMSA的设计使得在不需对输入图像或特征图进行降采样的情况下,能够提取并无缝融合跨多个尺度的特征。这是通过将基于窗口的局部注意力的分组多头自注意力机制与跨不同尺度的多尺度特征级联融合进行新颖组合来实现的。这种架构允许有效处理不同尺度的特征,增强了模型在低分辨率图像上执行人体姿态估计、头部姿态估计等任务的能力。我们的实验结果表明,所提出的方法在这些领域以更少的参数量超越了现有的最先进方法,展示了其在无法获取高分辨率图像的实际场景中广泛应用的潜力。代码可在https://github.com/xyongLu/CMSA获取。

关键词

引用

@article{arxiv.2412.02197,
  title  = {Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images},
  author = {Xiangyong Lu and Masanori Suganuma and Takayuki Okatani},
  journal= {arXiv preprint arXiv:2412.02197},
  year   = {2025}
}

备注

10 pages, 6 figures, 5 tables