中文

基于语义特征预测物体间相对深度

计算机视觉与模式识别 2021-01-13 v1 人工智能

摘要

视觉与语言任务,如视觉关系检测和视觉问答,受益于能够提供恰当语言落地的语义特征。二维图像中物体的三维深度即是这样一种特征。然而,若不学习依赖于场景的适当特征,很难获得准确的深度信息。该领域的最先进方法是复杂的神经网络模型,其在立体图像数据上训练以预测逐像素深度。幸运的是,在某些任务中,仅需要物体间的相对深度。本文研究了语义特征能在多大程度上预测粗略相对深度。该问题被建模为一个分类问题,并基于物体边界框、物体标签和场景属性计算几何特征,将其作为模式识别模型的输入以预测相对深度,即后方、前方和中性。结果与单目深度(monodepth)神经网络模型(代表最先进水平)输出的平均值所得结果进行比较。相对于由monodepth模型导出结果计算的相对深度,相对深度准确率总体提升了14%。

关键词

引用

@article{arxiv.2101.04626,
  title  = {Predicting Relative Depth between Objects from Semantic Features},
  author = {Stefan Cassar and Adrian Muscat and Dylan Seychell},
  journal= {arXiv preprint arXiv:2101.04626},
  year   = {2021}
}

备注

9 pages, 2 figures