中文

面向可泛化行人重识别的深度多模态融合

计算机视觉与模式识别 2023-01-02 v3

摘要

由于其在公共安全和视频监控中的多种应用,行人重识别在现实场景中发挥着重要作用。近来,受益于大规模数据集和强大计算性能的监督或半无监督学习范式,在特定目标域上已取得具有竞争力的性能。然而,当 Re-ID 模型在没有目标样本的新域中直接部署时,它们总是遭受显著的性能下降和较差的域泛化能力。为应对这一挑战,我们提出一种深度多模态融合网络,在预训练期间精心构建丰富的语义知识以辅助表征学习。重要的是,引入多模态融合策略将不同模态的特征映射到公共空间,可显著提升 Re-ID 模型的泛化能力。在微调阶段,采用真实数据集对预训练模型进行微调,以更好地与真实世界数据实现分布对齐。在基准数据集上的综合实验表明,我们的方法以明显优势显著优于以往的域泛化或元学习方法。我们的源代码也将公开于 https://github.com/JeremyXSC/DMF。

关键词

引用

@article{arxiv.2211.00933,
  title  = {Deep Multimodal Fusion for Generalizable Person Re-identification},
  author = {Suncheng Xiang and Hao Chen and Wei Ran and Zefang Yu and Ting Liu and Dahong Qian and Yuzhuo Fu},
  journal= {arXiv preprint arXiv:2211.00933},
  year   = {2023}
}