魔法标记:用于多模态目标重识别的多样化标记选择
计算机视觉与模式识别
2024-03-18 v1 信息检索
多媒体
摘要
单模态目标重识别(ReID)面临在复杂视觉情景中保持鲁棒性的巨大挑战。相比之下,多模态目标ReID利用来自不同模态的互补信息,显示出巨大的实际应用潜力。然而,先前方法容易受到无关背景的影响,通常忽视模态之间的差距。为此,我们提出了一种名为EDITOR的新型学习框架,用于从视觉Transformer中选择多样化的标记,用于多模态目标ReID。我们首先使用共享视觉Transformer从不同输入模态中提取标记特征。随后,我们引入空间-频率标记选择(SFTS)模块,以适应性方式选择包含空间和频率信息的目标导向标记。接着,我们采用层次化掩码聚合(HMA)模块来促进模块内及跨模态的特征交互。最后,为了进一步减轻背景的影响,我们提出了背景一致性约束(BCC)和目标导向特征细化(OCFR)。它们以两种新的损失函数形式,提高了特征的判别性,抑制背景干扰。结果是我们的框架能够为多模态目标ReID生成更具辨识力的特征。在三个多模态ReID基准数据集上的大量实验验证了我们方法的有效性。代码已提供:https://github.com/924973292/EDITOR。
关键词
引用
@article{arxiv.2403.10254,
title = {Magic Tokens: Select Diverse Tokens for Multi-modal Object Re-Identification},
author = {Pingping Zhang and Yuhao Wang and Yang Liu and Zhengzheng Tu and Huchuan Lu},
journal= {arXiv preprint arXiv:2403.10254},
year = {2024}
}
备注
This work is accepted by CVPR2024. More modifications may be performed