RaSa:面向基于文本行人搜索的关系与敏感性感知表征学习
计算机视觉与模式识别
2023-12-04 v1
摘要
基于文本的行人搜索旨在根据给定的文本描述检索指定的行人图像。解决这一极具挑战性任务的关键在于学习强大的多模态表征。为此,我们提出了一种关系与敏感性感知表征学习方法(RaSa),包含两项新任务:关系感知学习(RA)和敏感性感知学习(SA)。一方面,现有方法不加区分地对全部正样本对表征进行聚类,忽视了文本与配对图像存在噪声对应关系的弱正样本对所引发的噪声问题,从而导致过拟合学习。RA通过引入一种新的正样本关系检测任务(即学习区分强正样本对与弱正样本对)来抵消过拟合风险。另一方面,在数据增强下学习不变表征(即对某些变换不敏感)是现有方法中提升表征鲁棒性的通用做法。除此之外,我们通过SA鼓励表征感知敏感变换(即学习检测被替换的词),从而提升表征的鲁棒性。实验表明,RaSa在CUHK-PEDES、ICFG-PEDES和RSTPReid数据集上分别以Rank@1指标超越现有最先进方法6.94%、4.45%和15.35%。代码见:https://github.com/Flame-Chasers/RaSa。
引用
@article{arxiv.2305.13653,
title = {RaSa: Relation and Sensitivity Aware Representation Learning for Text-based Person Search},
author = {Yang Bai and Min Cao and Daming Gao and Ziqiang Cao and Chen Chen and Zhenfeng Fan and Liqiang Nie and Min Zhang},
journal= {arXiv preprint arXiv:2305.13653},
year = {2023}
}
备注
Accepted by IJCAI 2023. Code is available at https://github.com/Flame-Chasers/RaSa