重新审视视觉定位中兼具多样性与判别性的候选框生成
计算机视觉与模式识别
2018-05-10 v1
摘要
视觉定位旨在定位图像中由文本查询短语所指称的物体。已有多种视觉定位方法被提出,该问题可被模块化为一个通用框架:候选框生成、多模态特征表示与候选框排序。在这三个模块中,多数现有方法聚焦于后两者,而候选框生成的重要性通常被忽视。本文中,我们重新审视何种性质构成一个优良的候选框生成器这一问题。我们在生成候选框时同时引入多样性与判别性,并由此提出多样性与判别性候选框网络模型(DDPN)。基于 DDPN 生成的候选框,我们提出了一个高性能的视觉定位基线模型,并在四个基准数据集上进行了评估。实验结果表明,我们的模型在所有被测数据集上均带来显著提升(例如,相较现有 SOTA 分别在 ReferItGame 上提升 18.8%,在 Flickr30k Entities 上提升 8.2%)。
引用
@article{arxiv.1805.03508,
title = {Rethinking Diversified and Discriminative Proposal Generation for Visual Grounding},
author = {Zhou Yu and Jun Yu and Chenchao Xiang and Zhou Zhao and Qi Tian and Dacheng Tao},
journal= {arXiv preprint arXiv:1805.03508},
year = {2018}
}
备注
Accepted in IJCAI 2018