中文

基于热图嵌入的高效 Transformer 小目标检测方法 HMPE

计算机视觉与模式识别 2025-04-21 v1 多媒体

摘要

当前 Transformer-based 小目标检测方法层出不穷,但仍存在显著不足。本文引入 HeatMap Position Embedding(HMPE),一种新的 Transformer 优化技术,通过热图引导的自适应学习动态整合位置编码与语义检测信息,从而提升目标检测性能。我们还创新性地对 HMPE 方法进行可视化,为参数微调提供清晰的嵌入信息可视化。随后我们创建了 Multi-Scale ObjectBox-Heatmap Fusion Encoder(MOHFE)和 HeatMap Induced High-Quality Queries for Decoder(HIDQ)模块,分别用于编码器和解码器,以生成高质量查询并减少背景噪声查询。通过热图嵌入和 Linear-Snake Conv(LSConv)特征工程,我们增强了大量多样小目标类别的嵌入,并减少了解码器的多头层数,从而加快推理和训练速度。在泛化实验中,我们的方法在小目标数据集(NWPU VHR-10)上的 mAP 提升了 1.9%,在通用数据集(PASCAL VOC)上的 mAP 提升了 1.2%。通过 HMPE 增强的嵌入,我们能够将解码器层数从八层减少到最低三层,显著降低了推理和训练成本。

关键词

引用

@article{arxiv.2504.13469,
  title  = {HMPE:HeatMap Embedding for Efficient Transformer-Based Small Object Detection},
  author = {YangChen Zeng},
  journal= {arXiv preprint arXiv:2504.13469},
  year   = {2025}
}