面向可泛化行人重识别的鲁棒视觉-语义嵌入学习
计算机视觉与模式识别
2023-04-20 v1
摘要
可泛化行人重识别(Re-ID)是机器学习和计算机视觉中非常热门的研究课题,因其在公共安全和视频监控中的多种应用,在现实场景中发挥着重要作用。然而,以往方法主要关注视觉表示学习,而忽视在训练期间探索语义特征的潜力,这容易导致在适配到新领域时泛化能力较差。在本文中,我们提出了一种称为 MMET 的多模态等价 Transformer,分别在视觉、文本和视觉-文本任务上进行更鲁棒的视觉-语义嵌入学习。为了进一步增强 Transformer 上下文中的鲁棒特征学习,引入了一种称为掩码多模态建模策略(MMM)的动态掩码机制来掩码图像块和文本词元,其可联合作用于多模态或单模态数据,并显著提升可泛化行人 Re-ID 的性能。在基准数据集上的大量实验证明了我们的方法相对于以往方法的竞争性性能。我们希望该方法能推动视觉-语义表示学习的研究。我们的源代码也已公开于 https://github.com/JeremyXSC/MMET。
引用
@article{arxiv.2304.09498,
title = {Learning Robust Visual-Semantic Embedding for Generalizable Person Re-identification},
author = {Suncheng Xiang and Jingsheng Gao and Mengyuan Guan and Jiacheng Ruan and Chengfeng Zhou and Ting Liu and Dahong Qian and Yuzhuo Fu},
journal= {arXiv preprint arXiv:2304.09498},
year = {2023}
}