P$^2$HCT:用于多尺度特征融合的即插即用层次化C2F Transformer
计算机视觉与模式识别
2026-03-31 v3
摘要
特征融合在实现视觉模型高性能中起着关键作用,但现有的基于注意力的融合技术常常在资源受限环境下 suffer substantial computational overhead 和实现复杂度。为此,我们引入Plug-and-Play Hierarchical C2F Transformer (PHCT),一个轻量级模块,结合粗到细token选择和共享注意力参数,以保留空间细节同时降低推理成本。PHCT可以使用仅使用粗粒度注意力进行训练,在推理时可无需重新训练地激活以提升准确性。集成到YOLOv11-N/S/M等实时检测器中,PHCT在MS COCO上实现了0.9%、0.5%和0.4%的mAP提升,延迟增加极小。同样,将PHCT嵌入ResNet-18/50/101主干网络后,可在ImageNet上提高top-1准确率6.5%、1.7%和1.0%。这些结果凸显了PHCT作为面向硬件且通用性强的增强模块,对于检测和分类任务具有高效优势。
关键词
引用
@article{arxiv.2505.12772,
title = {P$^2$HCT: Plug-and-Play Hierarchical C2F Transformer for Multi-Scale Feature Fusion},
author = {Junyi Hu and Tian Bai and Fengyi Wu and Zhenming Peng and Yi Zhang},
journal= {arXiv preprint arXiv:2505.12772},
year = {2026}
}
备注
12 pages, 6 figures, ICME2026