中文

基于定位的情境识别

计算机视觉与模式识别 2020-03-27 v1

摘要

我们提出基于定位的情境识别(GSR),该任务需要生成描述以下内容的图像结构化语义摘要:主要活动、参与活动的实体及其角色(如施事者、工具),以及实体的边界框定位。GSR 提出了重要的技术挑战:识别语义显著性、对大量多样化实体进行分类与定位、克服语义稀疏性以及消歧角色。此外,与图像描述不同,GSR 易于评估。为研究这一新任务,我们创建了带定位的情境(SWiG)数据集,向 imsitu 数据集的 11,538 个实体类别添加了 278,336 个边界框定位。我们提出了一种联合情境定位器,发现通过端到端训练联合预测情境与定位,在整个定位指标套件上以 8% 至 32% 的相对增益轻松优于独立训练。最后,我们展示了模型启用的三个令人振奋的未来方向的初步发现:条件查询、视觉链式推理和基于定位语义感知的图像检索。代码与数据见 https://prior.allenai.org/projects/gsr。

关键词

引用

@article{arxiv.2003.12058,
  title  = {Grounded Situation Recognition},
  author = {Sarah Pratt and Mark Yatskar and Luca Weihs and Ali Farhadi and Aniruddha Kembhavi},
  journal= {arXiv preprint arXiv:2003.12058},
  year   = {2020}
}