Gramformer:通过图调制Transformer学习人群计数
计算机视觉与模式识别
2024-01-09 v1
摘要
Transformer因其突破了传统CNN有限的感受野,在近期的人群计数工作中广受欢迎。然而,由于人群图像通常包含大量相似图像块,Transformer中的自注意力机制倾向于找到一种同质化的解,即几乎所有图像块的注意力图都相同。本文针对这一问题提出Gramformer:一种图调制Transformer,通过基于两种不同类型的图分别调整注意力特征和输入节点特征来增强网络。首先,提出一种注意力图,旨在使注意力图多样化,以关注互补信息。该图基于图像块之间的差异性构建,以反相似性的方式调制注意力。其次,提出一种基于特征的中心性编码,用于发现节点的中心位置或重要性。我们使用所提出的中心性指标方案对其进行编码,以调制节点特征和相似性关系。在四个具有挑战性的人群计数数据集上进行的大量实验验证了所提方法的竞争力。代码见{https://github.com/LoraLinH/Gramformer}。
引用
@article{arxiv.2401.03870,
title = {Gramformer: Learning Crowd Counting via Graph-Modulated Transformer},
author = {Hui Lin and Zhiheng Ma and Xiaopeng Hong and Qinnan Shangguan and Deyu Meng},
journal= {arXiv preprint arXiv:2401.03870},
year = {2024}
}
备注
This is the accepted version of the paper and supplemental material to appear in AAAI 2024. Please cite the final published version. Code is available at {https://github.com/LoraLinH/Gramformer}