中文

巴别塔:结合图像、语言与三维几何的多模态视觉学习

计算机视觉与模式识别 2021-08-13 v1

摘要

过去二十年中,地标与城市的互联网照片之丰富与多样推动了三维视觉的重大进展,包括从游客照片中自动三维重建世界地标。然而,这些三维增强集合可用的一大信息源——即语言,例如来自图像描述文本——几乎未被利用。本工作中,我们提出WikiScenes,一个大规模地标照片集合新数据集,包含以描述文本与层次化类别名形式出现的说明性文字。WikiScenes构成了涉及图像、文本与三维几何的多模态推理新测试平台。我们展示了WikiScenes在图像与三维模型上学习语义概念的效用。我们的弱监督框架连接图像、三维结构与语义——利用三维几何提供的强约束——将语义概念关联到图像像素与三维点。

关键词

引用

@article{arxiv.2108.05863,
  title  = {Towers of Babel: Combining Images, Language, and 3D Geometry for Learning Multimodal Vision},
  author = {Xiaoshi Wu and Hadar Averbuch-Elor and Jin Sun and Noah Snavely},
  journal= {arXiv preprint arXiv:2108.05863},
  year   = {2021}
}

备注

Published in ICCV 2021; Project webpage: https://www.cs.cornell.edu/projects/babel/