中文

Placepedia:具备多面标注的全面场所理解数据集

计算机视觉与模式识别 2020-07-20 v4 计算与语言 信息检索

摘要

场所是视觉理解中的重要元素。给定一张建筑照片,人们通常能说出其功能(如餐厅或商店)、文化风格(如亚洲或欧洲)以及经济类型(如工业导向或旅游导向)。尽管场所识别在先前工作中已被广泛研究,但迈向全面场所理解仍有漫漫长路,这远超出用一张图像对场所分类,而是需要多方面的信息。在这项工作中,我们贡献了 Placepedia,一个包含来自 24 万个独特场所的超过 3500 万张照片的大规模场所数据集。除照片外,每个场所还带有海量多面信息(如 GDP、人口等)以及多层级标签(包括功能、城市、国家等)。该数据集凭借其海量数据与丰富标注,支持开展各类研究。特别地,在我们的研究中,我们开发了 1)PlaceNet,一个用于多级场所识别的统一框架;以及 2)一种城市嵌入方法,能为城市生成捕捉视觉与多面侧信息的向量表示。此类研究不仅揭示了场所理解中的关键挑战,也建立了视觉观测与潜在社会经济/文化含义之间的联系。

关键词

引用

@article{arxiv.2007.03777,
  title  = {Placepedia: Comprehensive Place Understanding with Multi-Faceted Annotations},
  author = {Huaiyi Huang and Yuqi Zhang and Qingqiu Huang and Zhengkui Guo and Ziwei Liu and Dahua Lin},
  journal= {arXiv preprint arXiv:2007.03777},
  year   = {2020}
}

备注

To appear in ECCV 2020. Dataset is available at: https://hahehi.github.io/placepedia.html