用于文本-RGBT行人检索的解耦跨模态对齐网络及高质量基准
计算机视觉与模式识别
2025-06-17 v2
摘要
由于可见光传感器的成像限制,传统文本-图像行人检索任务的性能极易受光照变化的影响。近年来,跨模态信息融合已成为增强检索鲁棒性的一种有效策略。通过整合来自不同光谱模态的互补信息,可以在复杂的现实条件下实现更稳定的行人识别与匹配。受此启发,我们引入了一项新任务:文本-RGBT行人检索,该任务通过结合可见光和热成像模态的互补线索进行跨光谱信息融合,以在充满挑战的环境中实现鲁棒的行人检索。文本-RGBT行人检索的关键挑战在于将文本与多模态视觉特征进行对齐。然而,可见光和热成像模态之间固有的异构性可能会干扰视觉与语言之间的对齐。为了解决这个问题,我们提出了一种解耦跨模态对齐网络(DCAlign),它充分挖掘特定模态和模态协作视觉与文本之间的关系,用于文本-RGBT行人检索。为了促进该领域的研究和发展,我们创建了一个高质量的文本-RGBT行人检索数据集 RGBT-PEDES。RGBT-PEDES 包含来自不同年龄组和性别的 1,822 个身份,具有 4,723 对配准的 RGB 和 T 图像,涵盖了白天和黑夜的高多样性场景,并包含遮挡、弱对齐和恶劣光照条件等各种挑战。此外,我们为所有 RGBT 行人图像对仔细标注了 7,987 条细粒度文本描述。在 RGBT-PEDES 上的大量实验表明,我们的方法优于现有的文本-图像行人检索方法。
引用
@article{arxiv.2503.07950,
title = {Decoupled Cross-Modal Alignment Network for Text-RGBT Person Retrieval and A High-Quality Benchmark},
author = {Yifei Deng and Chenglong Li and Zhenyu Chen and Zihen Xu and Jin Tang},
journal= {arXiv preprint arXiv:2503.07950},
year = {2025}
}