中文

Strip-Fusion:多光谱行人检测的时空融合

计算机视觉与模式识别 2026-01-27 v1

摘要

行人检测是机器人感知中的关键任务。多光谱模态(可见光和热成像)可以通过提供互补的视觉信息来提升行人检测性能。但现有多光谱行人检测方法仍存在若干问题:首先,现有方法主要关注空间融合,往往忽视了时间信息;其次,多光谱基准数据集中的 RGB 和热成像图像对可能并不总是完全对齐。此外,行人在不同光照条件下、遮挡等情况下仍难以检测。为此,本文提出 Strip-Fusion,一种对输入图像错位鲁棒、能适应不同光照条件和重遮挡的时空融合网络。Strip-Fusion 管道集成了时空自适应卷积,动态加权时空特征,使模型能够更好地捕获行人随时间的运动和上下文。设计了一种新的 KL 散度损失,以缓解可见光和热成像输入之间的模态不平衡,引导特征对齐 toward 更具信息性的模态。此外,开发了一种新的后处理算法以减少误报。大量实验结果表明,我们的方法在 KAIST 和 CVC-14 基准测试中表现具有竞争力。我们还发现,在诸如重遮挡和错位等具有挑战性的条件下,本方法相较于以往最先进的方法可显著提升。

关键词

引用

@article{arxiv.2601.18008,
  title  = {Strip-Fusion: Spatiotemporal Fusion for Multispectral Pedestrian Detection},
  author = {Asiegbu Miracle Kanu-Asiegbu and Nitin Jotwani and Xiaoxiao Du},
  journal= {arXiv preprint arXiv:2601.18008},
  year   = {2026}
}

备注

This work has been accepted for publication in IEEE Robotics and Automation Letters (RA-L). Code available at: https://github.com/akanuasiegbu/stripfusion