中文

基于深度强化学习的自然语言行人搜索

计算机视觉与模式识别 2018-09-05 v1 多媒体

摘要

深度强化学习近期的成功在于让智能体学习如何下围棋并在无任何先验游戏知识的情况下击败世界冠军。在该任务中,智能体必须根据棋子位置决定采取何种动作。行人搜索近来被探索用于基于自然语言图像文本描述的视频监控应用(S.Li等)。我们看到(Fu等)提供了一种使用深度强化学习的端到端基于对象的检索方法,且不对所检测对象施加约束。然而,我们认为对于诸如行人搜索的真实世界应用,定义识别一个人的特定约束,而非从通用对象检测开始,将在性能和所需计算资源方面带来益处。在我们的任务中,深度强化学习通过重塑边界框尺寸来定位图像中的行人。带有适当约束的深度强化学习将仅在图像中寻找相关行人,而非无约束方法中需对图像中每个独立对象进行排序。对于行人搜索,智能体试图在图像中围绕与描述匹配的行人形成紧密边界框。边界框初始化为整幅图像,在每时间步,智能体根据行人描述和当前边界框的像素值决定如何改变当前边界框,以使其更紧密地包围行人。智能体采取动作后,将根据当前边界框与真实框的交并比(IoU)获得奖励。一旦智能体认为边界框已覆盖行人,它将指示已找到该行人。

关键词

引用

@article{arxiv.1809.00365,
  title  = {Natural Language Person Search Using Deep Reinforcement Learning},
  author = {Ankit Shah and Tyler Vuong},
  journal= {arXiv preprint arXiv:1809.00365},
  year   = {2018}
}

备注

Equal Contribution - Work in Progress. Preprint results