Ref-NMS:打破两阶段指代表达定位中的候选框瓶颈
计算机视觉与模式识别
2021-03-11 v3 人工智能
计算与语言
多媒体
摘要
解决指代表达定位的主流框架基于两阶段过程:1)用目标检测器检测候选框;2)将指称对象定位到其中一个候选框。现有的两阶段方案大多聚焦于定位步骤,旨在将表达与候选框对齐。本文认为,这些方法忽视了一个明显的候选框在两阶段中角色不匹配的问题:它们仅基于检测置信度(即与表达无关)生成候选框,却希望这些候选框包含表达中所有正确的实例(即与表达相关)。由于这种不匹配,当前两阶段方法在检测候选框与真实候选框之间存在严重的性能下降。为此,我们提出 Ref-NMS,这是首个在第一阶段生成与表达相关候选框的方法。Ref-NMS 将表达中的所有名词视为关键对象,并引入一个轻量级模块来预测每个边界框与关键对象对齐的分数。这些分数可引导 NMS 操作过滤掉与表达无关的框,提高关键对象的召回率,从而显著提升定位性能。由于 Ref-NMS 与定位步骤无关,它可轻松集成到任何最先进的两阶段方法中。在多个骨干网络、基准和任务上的大量消融研究一致证明了 Ref-NMS 的优越性。代码见:https://github.com/ChopinSharp/ref-nms。
引用
@article{arxiv.2009.01449,
title = {Ref-NMS: Breaking Proposal Bottlenecks in Two-Stage Referring Expression Grounding},
author = {Long Chen and Wenbo Ma and Jun Xiao and Hanwang Zhang and Shih-Fu Chang},
journal= {arXiv preprint arXiv:2009.01449},
year = {2021}
}
备注
Camera ready version at AAAI 2021, Codes are available at: https://github.com/ChopinSharp/ref-nms