中文

面向文本驱动全图像人搜索的不确定性感知特征原型语义解耦

计算机视觉与模式识别 2025-09-03 v3

摘要

文本驱动行人搜索 (TBPS) 旨在利用自然语言描述在未裁剪的图像中定位目标行人。然而,在包含多个行人的复杂场景中,现有方法受限于检测和匹配中的不确定性,导致性能下降。为此,我们提出了 UPD-TBPS 框架,包含三个模块:多粒度不确定性估计 (MUE)、原型基不确定性解耦 (PUD) 和跨模态重识别 (ReID)。MUE 通过多粒度查询识别潜在目标并赋予置信度评分,以减少早期阶段的不确定性。PUD 利用视觉上下文解耦和原型挖掘,从查询中提取目标行人特征。它在粗粒度聚类层级和细粒度 individual 层级上分离并学习行人原型表示,从而降低匹配不确定性。ReID 评估具有不同置信度水平的候选者,提高检测和检索准确性。在 CUHK-SYSU-TBPS 和 PRW-TBPS 数据集上进行实验验证了该框架的有效性。

关键词

引用

@article{arxiv.2505.03567,
  title  = {Uncertainty-Aware Prototype Semantic Decoupling for Text-Based Person Search in Full Images},
  author = {Zengli Luo and Canlong Zhang and Zhixin Li and Zhiwen Wang and Chunrong Wei},
  journal= {arXiv preprint arXiv:2505.03567},
  year   = {2025}
}

备注

9 pages, 5 figures. Accepted by the 18th International Conference on Knowledge Science, Engineering and Management (KSEM 2025)