ViTAA:基于自然语言的人员搜索中视觉-文本属性对齐
计算机视觉与模式识别
2020-07-31 v2
摘要
基于自然语言的人员搜索旨在从大规模图像库中检索出与给定文本描述相匹配的特定人员。当前多数方法将该任务视为整体视觉与文本特征匹配问题,而我们则从属性对齐的视角切入,从而将特定属性短语定位到对应的视觉区域。我们通过鲁棒的特征学习取得了成功并提升了性能,其中所指身份可由多个属性视觉线索准确绑定。具体而言,我们的视觉-文本属性对齐模型(称为 ViTAA)利用一个轻量辅助属性分割计算分支,将人员特征空间解耦为对应于各属性的子空间。随后,通过使用一种新颖的对比学习损失,将这些视觉特征与从句子中解析出的文本属性对齐。在此基础上,我们通过在基于自然语言和基于属性短语查询的人员搜索任务上的大量实验验证了 ViTAA 框架,我们的系统在该任务上取得了最先进的性能。代码将在发表后公开。
引用
@article{arxiv.2005.07327,
title = {ViTAA: Visual-Textual Attributes Alignment in Person Search by Natural Language},
author = {Zhe Wang and Zhiyuan Fang and Jun Wang and Yezhou Yang},
journal= {arXiv preprint arXiv:2005.07327},
year = {2020}
}
备注
ECCV2020, 18 pages, 6 figures