开放词汇场景解析
计算机视觉与模式识别
2017-04-06 v2 人工智能
摘要
由于现有分类模型和数据集的局限性,在自然场景中识别任意物体一直是一个具有挑战性的问题。本文提出了一项新任务,旨在解析具有大规模开放词汇的场景,并为此问题探索了若干评估指标。我们针对该问题提出的方法是一个联合图像像素与词概念嵌入框架,其中词概念通过语义关系相互连接。我们在覆盖多种场景和物体的ADE20K数据集上验证了该框架的开放词汇预测能力。我们进一步探索了训练得到的联合嵌入空间,以展示其可解释性。
引用
@article{arxiv.1703.08769,
title = {Open Vocabulary Scene Parsing},
author = {Hang Zhao and Xavier Puig and Bolei Zhou and Sanja Fidler and Antonio Torralba},
journal= {arXiv preprint arXiv:1703.08769},
year = {2017}
}