弥合鸿沟:面向可见光-红外行人重识别的多级跨模态联合对齐
计算机视觉与模式识别
2024-03-22 v1
摘要
可见光-红外行人重识别(VI-ReID)是一项具有挑战性的跨模态图像检索任务,旨在跨可见光与红外相机匹配行人图像。为解决模态鸿沟,现有主流方法采用将图像检索任务转化为带交叉熵损失与辅助度量学习损失的图像分类任务的学习范式。这些损失遵循调整所提取嵌入分布以减小类内距离、增大类间距离的策略。然而,此类目标与检索任务的最终测试设定并不精确对应,导致在优化层面出现新的鸿沟。通过重新审视VI-ReID的这些关键,我们提出一种简单有效的方法——多级跨模态联合对齐(MCJA),弥合模态与 objective 层面的鸿沟。对于前者,我们设计了模态对齐增强,其包含三种新策略:加权灰度、跨通道cutmix与频谱抖动增强,有效降低图像空间中的模态差异。对于后者,我们引入一种新的跨模态检索损失。这是首项从排序列表视角进行约束、与测试阶段目标对齐的工作。此外,仅基于全局特征,我们的方法即展现出良好性能,并可作为VI-ReID领域的强基线方法。
引用
@article{arxiv.2307.08316,
title = {Bridging the Gap: Multi-Level Cross-Modality Joint Alignment for Visible-Infrared Person Re-Identification},
author = {Tengfei Liang and Yi Jin and Wu Liu and Tao Wang and Songhe Feng and Yidong Li},
journal= {arXiv preprint arXiv:2307.08316},
year = {2024}
}
备注
10 pages, 4 figures, 5 tables