基于 Transformer 的双光谱注意力融合群体头点计数与定位网络
计算机视觉与模式识别
2025-05-13 v1
摘要
本文提出了一种双光谱注意力融合群体头点计数模型(TAPNet),旨addresses UAV 视角下群体计数任务中存在的复杂场景(如群体密集遮挡、低光环境)下的准确计数困难问题。该模型通过引入红外图像中的互补信息,设计了双光谱注意力融合模块(DAFP),以提高全天候群体计数的准确性和鲁棒性。为充分利用不同模态信息,并解决图像对系统性错位导致的定位不准问题,本文还提出了自适应双光谱特征分解融合模块(AFDF)。此外,我们通过空间随机偏移数据增强优化了训练策略,以提高模型的鲁棒性。在两个具有挑战性的公开数据集 DroneRGBT 和 GAIIC2 上的实验表明,所提方法在性能上优于现有技术,尤其在密集低光场景中表现突出。代码已公开于 https://github.com/zz-zik/TAPNet
引用
@article{arxiv.2505.06937,
title = {Transformer-Based Dual-Optical Attention Fusion Crowd Head Point Counting and Localization Network},
author = {Fei Zhou and Yi Li and Mingqing Zhu},
journal= {arXiv preprint arXiv:2505.06937},
year = {2025}
}