面向不完整基于文本行人重识别的原型引导跨模态补全与对齐
计算机视觉与模式识别
2023-10-04 v2
摘要
传统的基于文本的行人重识别(ReID)技术严重依赖完全匹配的多模态数据,这是一种理想情形。然而,由于跨模态数据在采集与处理过程中不可避免的数据缺失与损坏,现实应用中常遇到不完整数据问题。因此,我们考虑一项更实际的任务,称为不完整的基于文本的ReID任务,其中行人图像与文本描述并非完全匹配且包含部分缺失的模态数据。为此,我们提出一种新颖的原型引导跨模态补全与对齐(PCCA)框架来处理上述不完整基于文本ReID的问题。具体而言,我们无法基于文本查询在缺失模态数据上直接检索行人图像。因此,我们通过计算现有图像与文本之间的跨模态相似度,提出针对缺失数据的跨模态最近邻构建策略,为缺失模态特征的补全提供关键指导。此外,为高效补全缺失模态特征,我们利用上述缺失模态数据的跨模态最近邻集合及相应原型构建关系图,可进一步增强生成的缺失模态特征。另外,为实现图像与文本间更紧密的细粒度对齐,我们提出原型感知跨模态对齐损失,能有效缩小模态异质性鸿沟,从而在公共空间中实现更好的细粒度对齐。在多个具有不同缺失比例的基准上的大量实验结果充分表明,我们的方法能持续优于最先进的文本-图像ReID方法。
引用
@article{arxiv.2309.17104,
title = {Prototype-guided Cross-modal Completion and Alignment for Incomplete Text-based Person Re-identification},
author = {Tiantian Gong and Guodong Du and Junsheng Wang and Yongkang Ding and Liyan Zhang},
journal= {arXiv preprint arXiv:2309.17104},
year = {2023}
}
备注
Sorry, some collaborators do not agree to publish it on Arxiv, so please withdraw this paper