中文

CONQUER:面向基于文本行人搜索的上下文感知表示与查询增强

计算机视觉与模式识别 2026-01-27 v1

摘要

基于文本的行人搜索 (TBPS) 旨在使用自然语言描述从大型图库中检索行人图像。这项对公共安全应用至关重要的任务受到跨模态差异和模糊用户查询的阻碍。我们引入了 CONQUER,这是一个两阶段框架,旨在通过在训练期间增强跨模态对齐并在推理时自适应地细化查询来解决这些挑战。在训练期间,CONQUER 采用多粒度编码、互补对挖掘以及基于最优传输的上下文引导最优匹配来学习鲁棒的嵌入。在推理时,一个即插即用的查询增强模块通过锚点选择和属性驱动的扩充来细化模糊或不完整的查询,而无需重新训练骨干网络。在 CUHK-PEDES、ICFG-PEDES 和 RSTPReid 上的大量实验表明,CONQUER 在 Rank-1 准确率和 mAP 上始终优于强基线,在跨域和不完整查询场景中取得了显著改进。这些结果突显了 CONQUER 是一种实用且有效的解决方案,适用于真实世界的 TBPS 部署。源代码可在 https://github.com/zqxie77/CONQUER 获取。

关键词

引用

@article{arxiv.2601.18625,
  title  = {CONQUER: Context-Aware Representation with Query Enhancement for Text-Based Person Search},
  author = {Zequn Xie},
  journal= {arXiv preprint arXiv:2601.18625},
  year   = {2026}
}

备注

Accepted by ICASSP 2026