中文

去混杂的视觉定位

计算机视觉与模式识别 2022-01-03 v1 计算与语言

摘要

我们关注视觉定位流程中语言与位置之间的混杂偏置,发现该偏置是主要的视觉推理瓶颈。例如,由于大多数关于羊的查询其真值位置在图像中心,定位过程通常是一种无视觉推理的平凡语言-位置关联,例如将任何含“羊”的语言查询定位到近中心区域。首先,我们将视觉定位流程构建为因果图,展示图像、查询、目标位置与潜在混杂因子间的因果关系。借助因果图,我们明确了如何打破定位瓶颈:去混杂视觉定位。其次,为应对混杂因子通常不可观测的挑战,我们提出一种称为指代表达去混杂器(RED)的混杂因子无关方法,以消除混杂偏置。第三,我们将 RED 实现为一种简单的语言注意力,可应用于任意定位方法。在流行基准上,RED 以显著幅度改进了多种最先进(SOTA)定位方法。代码将很快发布于:https://github.com/JianqiangH/Deconfounded_VG。

关键词

引用

@article{arxiv.2112.15324,
  title  = {Deconfounded Visual Grounding},
  author = {Jianqiang Huang and Yu Qin and Jiaxin Qi and Qianru Sun and Hanwang Zhang},
  journal= {arXiv preprint arXiv:2112.15324},
  year   = {2022}
}

备注

AAAI 2022 Accepted