基于动态不确定性学习的带噪声文本人搜索
计算机视觉与模式识别
2026-03-03 v3
摘要
文本到图像的人搜索旨在根据文本描述识别个体。为减少数据收集成本,大规模文本-图像数据集从在线上找到的共现对中构建。然而,这会引入噪声,尤其是不匹配的对,这会降低检索性能。现有方法通常关注负样本,这会放大这种噪声。为解决这些问题,我们提出了动态不确定性和关系对齐 (DURA) 框架,包括关键特征选择器 (KFS) 和新的损失函数——动态软最大 hinge loss (DSH-Loss)。KFS 捕捉并建模噪声不确定性,提高检索可靠性。跨模态相似性的双向证据被建模为 Dirichlet 分布,以增强对噪声数据的适应性。DSH 调整负样本的难度,以提高在噪声环境下的鲁棒性。我们的实验在三个数据集上表明,该方法在低噪声和高噪声场景中都具有强大的噪声抗性,并提升了检索性能。
引用
@article{arxiv.2505.06566,
title = {Dynamic Uncertainty Learning with Noisy Correspondence for Text-Based Person Search},
author = {Zequn Xie and Haoming Ji and Chengxuan Li and Lingwei Meng},
journal= {arXiv preprint arXiv:2505.06566},
year = {2026}
}