SIRI:用于空间描述解析的空间关系诱导网络
计算机视觉与模式识别
2020-10-28 v1
摘要
空间描述解析作为一项语言引导的定位任务,被提出用于在给定相应语言描述的情况下在全景街景中定位目标。显式刻画对象级关系同时提炼空间关系目前尚缺失但对本任务至关重要。模仿人类以第一人称视角依次遍历空间关系词与对象来定位其目标,我们提出了一种新颖的空间关系诱导(SIRI)网络。具体而言,视觉特征首先在投影潜空间中于隐式对象级上建立关联;随后由每个空间关系词对其进行提炼,产生各自代表每种空间关系的不同激活特征。进一步,我们引入全局位置先验以弥补位置信息的缺失,后者可能导致全局位置推理歧义。语言与视觉特征均被拼接以完成目标定位。在 Touchdown 上的实验结果表明,按 80 像素半径度量,我们的方法在准确率上比最先进(SOTA)方法高出约 24%。我们的方法也在我们使用与 Touchdown 相同设置收集的扩展数据集上泛化良好。
引用
@article{arxiv.2010.14301,
title = {SIRI: Spatial Relation Induced Network For Spatial Description Resolution},
author = {Peiyao Wang and Weixin Luo and Yanyu Xu and Haojie Li and Shugong Xu and Jianyu Yang and Shenghua Gao},
journal= {arXiv preprint arXiv:2010.14301},
year = {2020}
}
备注
Accepted at NeurIPS 2020; Peiyao Wang and Weixin Luo made equal contribution