中文

开放词汇场景解析

计算机视觉与模式识别 2017-04-06 v2 人工智能

摘要

由于现有分类模型和数据集的局限性,在自然场景中识别任意物体一直是一个具有挑战性的问题。本文提出了一项新任务,旨在解析具有大规模开放词汇的场景,并为此问题探索了若干评估指标。我们针对该问题提出的方法是一个联合图像像素与词概念嵌入框架,其中词概念通过语义关系相互连接。我们在覆盖多种场景和物体的ADE20K数据集上验证了该框架的开放词汇预测能力。我们进一步探索了训练得到的联合嵌入空间,以展示其可解释性。

关键词

引用

@article{arxiv.1703.08769,
  title  = {Open Vocabulary Scene Parsing},
  author = {Hang Zhao and Xavier Puig and Bolei Zhou and Sanja Fidler and Antonio Torralba},
  journal= {arXiv preprint arXiv:1703.08769},
  year   = {2017}
}