中文

基于深度强化学习的迭代收缩指称表达定位方法

计算机视觉与模式识别 2021-03-10 v1

摘要

本文致力于解决无候选框(proposal-free)的指称表达定位任务,旨在依据查询语句定位目标物体,而不依赖现成的物体候选框。现有的无候选框方法采用查询-图像匹配分支在图像特征图中选择得分最高的点作为目标框中心,并由另一分支预测其宽和高。然而,此类方法未能利用目标物体与参考物体之间的上下文关系,且缺乏对其推理过程的可解释性。为解决这些问题,我们提出一种迭代收缩机制来定位目标,其中收缩方向由强化学习智能体决定,并综合考虑当前图像块内的全部内容。此外,顺序收缩过程能够展示如何迭代寻找目标的推理过程。实验表明,在RefCOCOg数据集上,所提方法相较先前最优(SOTA)方法的准确率提升了4.32%,该数据集查询语句长且复杂,许多目标通过其他参考物体来指代。

关键词

引用

@article{arxiv.2103.05187,
  title  = {Iterative Shrinking for Referring Expression Grounding Using Deep Reinforcement Learning},
  author = {Mingjie Sun and Jimin Xiao and Eng Gee Lim},
  journal= {arXiv preprint arXiv:2103.05187},
  year   = {2021}
}