中文

FusionCounting:基于多任务学习的鲁棒可见-红外图像融合,辅以人群计数

计算机视觉与模式识别 2025-09-03 v2

摘要

可见光和红外图像融合(VIF)是计算机视觉中的重要多媒体任务。大多数VIF方法主要关注优化融合图像的质量。最近的研究开始致力于整合下游任务,如语义分割和目标检测,以提供语义指导。然而,语义分割需要大量标注,而目标检测虽然减少了标注工作,却在高度拥挤的场景中面临重叠边界框和遮挡的挑战。此外,尽管RGB-T人群计数近年来受到关注,但尚无研究将VIF与人群计数整合到统一框架中。为解决这些挑战,我们提出FusionCounting,一种 novel 多任务学习框架,将人群计数集成到VIF过程中。人群计数以最小标注提供人口密度的直接定量度量,特别适用于密集场景。我们的框架在多任务设计中互相利用输入图像和人口密度信息。为加速收敛并平衡任务贡献,我们引入动态损失函数加权策略。此外,我们采用对抗训练来增强VIF和人群计数的鲁棒性,提高模型对抗攻击的稳定性和韧性。在公开数据集上的实验结果表明,FusionCounting不仅提升了图像融合质量,还实现了卓越的人群计数性能。

关键词

引用

@article{arxiv.2508.20817,
  title  = {FusionCounting: Robust visible-infrared image fusion guided by crowd counting via multi-task learning},
  author = {He Li and Xinyu Liu and Weihang Kong and Xingchen Zhang},
  journal= {arXiv preprint arXiv:2508.20817},
  year   = {2025}
}

备注

11 pages, 9 figures