面向文本到图像行人重识别的噪声对应学习
计算机视觉与模式识别
2024-03-29 v3 多媒体
摘要
文本到图像行人重识别(TIReID)是跨模态领域一个引人关注的话题,旨在基于文本查询检索目标行人。尽管已提出众多 TIReID 方法并取得良好性能,它们隐式假设训练图像-文本对正确对齐,而现实场景中并非总是如此。实际上,由于图像质量低与标注错误,图像-文本对不可避免地存在欠相关甚至错误相关,即噪声对应(NC)。为解决该问题,我们提出一种新颖的鲁棒双嵌入方法(RDE),即便存在 NC 也能学习鲁棒的视觉-语义关联。具体而言,RDE 包含两个主要组件:1)置信共识划分(CCD)模块,利用双嵌入模块的双粒度决策获得干净训练数据共识集,使模型学习正确可靠的视觉-语义关联。2)三元组对齐损失(TAL)将常规采用最困难负样本的三元组排序损失松弛为对所有负样本的对数-指数上界,从而在 NC 下防止模型崩溃,并能聚焦于困难负样本以获得良好性能。我们在 CUHK-PEDES、ICFG-PEDES 与 RSTPReID 三个公开基准上开展大量实验,评估 RDE 的性能与鲁棒性。我们的方法在含与不含合成噪声对应的所有三个数据集上均取得 SOTA 结果。代码见 https://github.com/QinYang79/RDE。
引用
@article{arxiv.2308.09911,
title = {Noisy-Correspondence Learning for Text-to-Image Person Re-identification},
author = {Yang Qin and Yingke Chen and Dezhong Peng and Xi Peng and Joey Tianyi Zhou and Peng Hu},
journal= {arXiv preprint arXiv:2308.09911},
year = {2024}
}