DSSL:用于基于文本行人检索的深度环境与行人分离学习
计算机视觉与模式识别
2021-09-14 v1
摘要
许多先前关于基于文本行人检索任务的方法致力于学习一个潜层公共空间映射,目的是从视觉与文本两种模态中提取模态不变特征。然而,由于高维数据的复杂性,无约束映射范式无法恰当捕捉对应行人的判别性线索,同时丢弃了未对齐的信息。直观上,视觉数据中包含的信息可分为行人信息(PI)与环境信息(SI),二者彼此互斥。为此,本文提出一种新颖的深度环境与行人分离学习(DSSL)模型,以有效提取并匹配行人信息,从而实现更优的检索精度。环境与行人分离与融合机制在互排斥约束下实现准确有效的环境与行人分离中起关键作用。为充分利用多模态与多粒度信息以获得更高检索精度,采用了五种多样的 alignment 范式。我们在 CUHK-PEDES 上进行了大量实验以评估所提出的 DSSL,该数据集目前是基于文本行人检索任务唯一可获取的数据集。DSSL 在 CUHK-PEDES 上取得了 SOTA 性能。为在真实场景中恰当评估我们所提出的 DSSL,我们构建了一个真实场景基于文本行人重识别(RSTPReid)数据集以惠及未来基于文本行人检索的研究,该数据集将公开可用。
引用
@article{arxiv.2109.05534,
title = {DSSL: Deep Surroundings-person Separation Learning for Text-based Person Retrieval},
author = {Aichun Zhu and Zijie Wang and Yifeng Li and Xili Wan and Jing Jin and Tian Wang and Fangqiang Hu and Gang Hua},
journal= {arXiv preprint arXiv:2109.05534},
year = {2021}
}
备注
Accepted by ACM MM'21