中文

基于Transformer的多模态融合模型用于视觉与无线信号有效人群计数

计算机视觉与模式识别 2025-04-30 v1 机器学习

摘要

当前的人群计数模型通常依赖单一模态输入,如视觉图像或无线信号数据,可能导致显著的信息损失和次优的识别性能。为解决这些不足之处,我们提出TransFusion,一种基于多模态融合的人群计数模型,将信道状态信息(CSI)与图像数据相结合。通过利用Transformer网络的强大能力,TransFusion有效地整合了这两种不同的数据模态,实现了对准确人群估计至关重要的全面全局上下文信息的捕获。然而,虽然Transformer在捕获全局特征方面表现良好,但可能无法识别精确人群计数所必需的更细粒度的局部细节。为缓解这一问题,我们将卷积神经网络(CNN)融入模型架构,增强了其提取细节局部特征的能力,这些特征补充了Transformer提供的全局上下文。广泛的实验评估表明,TransFusion在保持卓越效率的同时,以最小的计数误差实现了高准确率。

关键词

引用

@article{arxiv.2504.20178,
  title  = {A Transformer-based Multimodal Fusion Model for Efficient Crowd Counting Using Visual and Wireless Signals},
  author = {Zhe Cui and Yuli Li and Le-Nam Tran},
  journal= {arXiv preprint arXiv:2504.20178},
  year   = {2025}
}

备注

This paper was accepted at IEEE WCNC 2025