基于最难与半难负样本对挖掘的视觉-文本关联行人搜索方法
计算机视觉与模式识别
2019-12-09 v1
摘要
以自然语言描述作为查询在大规模图像库中搜索行人,是视频监控中一项更具实用性的重要应用。直观而言,对于行人搜索,核心问题应是视觉-文本关联,由于文本描述的高度抽象与视觉图像的直观表达之间的矛盾,这仍是一项极具挑战的任务。然而,对于该任务,虽然正样本图像-文本对总能被很好地提供,现有多数方法并未通过挖掘更合理的负样本对来有效解决此问题。本文提出一种新颖的视觉-文本关联方法,结合视觉与文本注意力,以及跨模态最难与半难负样本对挖掘。为评估所提方法的有效性与可行性,我们在典型行人搜索数据集 CUHK-PEDES 上进行了大量实验,我们的方法以 55.32% 的 top1 准确率成为新的 SOTA。此外,我们还在 COCO caption 数据集上评估了半难样本对挖掘方法,并验证了各方法的有效性与互补性。
引用
@article{arxiv.1912.03083,
title = {Visual-Textual Association with Hardest and Semi-Hard Negative Pairs Mining for Person Search},
author = {Jing Ge and Guangyu Gao and Zhen Liu},
journal= {arXiv preprint arXiv:1912.03083},
year = {2019}
}