中文

一种用于指代表达理解的实数跨模态相关滤波方法

计算机视觉与模式识别 2020-04-28 v4

摘要

指代表达理解旨在定位由自然语言描述所指定的物体实例。当前的指代表达方法已取得良好性能,然而无一能在不损失精度的情况下实现实时推理。推理速度相对较慢的原因在于这些方法人为地将指代表达理解拆分为两个顺序阶段,包括候选框生成与候选框排序,这并不完全符合人类认知习惯。为此,我们提出一种新颖的实时跨模态相关滤波方法(RCCF)。RCCF 将指代表达理解重新表述为一个相关滤波过程:表达式首先从语言域映射到视觉域,然后作为模板(核)在图像特征图上进行相关滤波。相关热力图中的峰值指示目标框的中心点。此外,RCCF 还回归一个二维物体尺寸与二维偏移量,中心点坐标、物体尺寸与中心点偏移共同构成目标边界框。我们的方法以 40 FPS 运行,同时在 RefClef、RefCOCO、RefCOCO+ 和 RefCOCOg 基准上取得领先性能。在具有挑战性的 RefClef 数据集上,我们的方法几乎将最优性能提升一倍(从 34.70% 提升至 63.79%)。我们希望本工作能引起更多对新型跨模态相关滤波框架以及指代表达理解单阶段框架的关注与研究。

关键词

引用

@article{arxiv.1909.07072,
  title  = {A Real-Time Cross-modality Correlation Filtering Method for Referring Expression Comprehension},
  author = {Yue Liao and Si Liu and Guanbin Li and Fei Wang and Yanjie Chen and Chen Qian and Bo Li},
  journal= {arXiv preprint arXiv:1909.07072},
  year   = {2020}
}

备注

Accepted by CVPR 2020