基于自然语言查询的时空行人检索
计算机视觉与模式识别
2017-08-24 v2
摘要
在本文中,我们解决利用自然语言查询从多个视频中进行时空行人检索的问题,输出一个包围查询所描述行人的tube(即边界框序列)。针对该问题,我们引入了一个新颖的数据集,由包含人的视频组成,标注了每秒的边界框以及五条自然语言描述。为检索给定自然语言查询所描述的行人的tube,我们设计了一个结合时空人体检测与多模态检索方法的模型。我们进行了全面实验,比较多种tube与文本表示以及多模态检索方法,并给出了该任务的一个强基线,同时展示了我们的tube表示与多模态特征嵌入技术的功效。最后,我们通过将模型应用于另外两个重要任务来展示其通用性。
引用
@article{arxiv.1704.07945,
title = {Spatio-temporal Person Retrieval via Natural Language Queries},
author = {Masataka Yamaguchi and Kuniaki Saito and Yoshitaka Ushiku and Tatsuya Harada},
journal= {arXiv preprint arXiv:1704.07945},
year = {2017}
}
备注
Accepted to ICCV2017