通过上下文感知深度强化学习的自然语言目标检索端到端方法
计算机视觉与模式识别
2017-03-23 v1
摘要
我们提出了一种用于自然语言目标检索任务的端到端方法,该任务根据自然语言描述(即指称表达)在图像中定位目标。以往的工作将这一问题分为两个独立的阶段:首先,在不探索语言描述的情况下从图像中计算候选区域;其次,根据指称表达对目标候选进行评分并选择排名最高的候选。目标候选的生成独立于指称表达,这使得候选生成变得冗余,甚至与所指目标无关。在本工作中,我们利用深度强化学习训练一个智能体,该智能体学习移动并调整边界框以根据指称表达定位目标。我们将空间和时间上下文信息都纳入训练过程。通过同时利用局部视觉信息、空间和时间上下文以及指称语言先验,智能体在每个时刻选择适当的动作。我们定义了一个特殊动作来指示智能体何时找到所指目标并终止该过程。我们在多个数据集上评估了我们的模型,我们的算法显著优于对比算法。值得注意的是,我们的方法在 ReferItGame 数据集上相对于近期方法 GroundeR 和 SCRC 的准确率提升分别为 7.67% 和 18.25%。
引用
@article{arxiv.1703.07579,
title = {An End-to-End Approach to Natural Language Object Retrieval via Context-Aware Deep Reinforcement Learning},
author = {Fan Wu and Zhongwen Xu and Yi Yang},
journal= {arXiv preprint arXiv:1703.07579},
year = {2017}
}