中文

面向文本到图像行人检索的多路径探索与反馈调整

计算机视觉与模式识别 2024-10-30 v1 人工智能

摘要

基于文本的行人检索旨在使用文本描述作为查询来识别特定行人。现有的先进方法通常依赖于视觉-语言预训练(VLP)模型来促进有效的跨模态对齐。然而,VLP模型固有的局限性,包括全局对齐偏差和不足的自我反馈调节,阻碍了最佳检索性能。在本文中,我们提出了MeFa,一个多路径探索、反馈与调整框架,它深入探索模态内和模态间的内在反馈以进行有针对性的调整,从而实现更精确的行人-文本关联。具体来说,我们首先设计了一个模态内推理路径,为跨模态数据生成困难负样本,利用这些样本的反馈来细化模态内推理,从而增强对细微差异的敏感性。随后,我们引入了一个跨模态细化路径,利用全局信息和模态间反馈来细化局部信息,从而增强其全局语义表示。最后,判别性线索校正路径将次要相似度的细粒度特征作为判别性线索,以进一步缓解由这些特征差异引起的检索失败。在三个公开基准上的实验结果表明,MeFa在不需额外数据或复杂结构的情况下,实现了优越的行人检索性能。

关键词

引用

@article{arxiv.2410.21318,
  title  = {Multi-path Exploration and Feedback Adjustment for Text-to-Image Person Retrieval},
  author = {Bin Kang and Bin Chen and Junjie Wang and Yong Xu},
  journal= {arXiv preprint arXiv:2410.21318},
  year   = {2024}
}