基于掩码参考中心点监督的迭代鲁棒视觉定位
计算机视觉与模式识别
2023-07-25 v1
摘要
视觉定位(VG)旨在根据给定表达从图像中定位目标物体,随着检测与视觉Transformer的发展已取得显著进展。然而,现有VG方法在面对实际应用中常见的不准确或无关描述时,往往会产生虚警物体。此外,现有方法无法从整幅图像与文本描述中捕获细粒度特征、精确定位以及充分的上下文理解。为同时解决这两个问题,我们提出了一种基于掩码参考中心点监督(MRCS)的迭代鲁棒视觉定位(IR-VG)框架。该框架引入迭代多级视觉-语言融合(IMVF)以实现更好的对齐。我们利用MRCS通过点级特征监督实现更精确的定位。进而,为提升VG的鲁棒性,我们还提出了多阶段虚警敏感解码器(MFSD),以在不准确表达出现时阻止虚警物体的生成。所提框架在五个常规VG数据集与两个新构建的鲁棒VG数据集上进行了评估。大量实验表明,IR-VG取得了新的state-of-the-art (SOTA)结果,在两个新提出的鲁棒VG数据集上相较现有SOTA方法分别提升25%和10%。此外,该框架在五个常规VG数据集上也被验证有效。代码与模型将公开于https://github.com/cv516Buaa/IR-VG。
引用
@article{arxiv.2307.12392,
title = {Iterative Robust Visual Grounding with Masked Reference based Centerpoint Supervision},
author = {Menghao Li and Chunlei Wang and Wenquan Feng and Shuchang Lyu and Guangliang Cheng and Xiangtai Li and Binghao Liu and Qi Zhao},
journal= {arXiv preprint arXiv:2307.12392},
year = {2023}
}