中文

基于深度分层上下文网络的图像标注

计算机视觉与模式识别 2020-12-22 v1

摘要

上下文建模是视觉识别中最富成果的子类之一,旨在设计判别性图像表示的同时纳入其内在与外在关系。然而,上下文建模的潜力目前未被充分发掘,且现有多数方案要么无上下文,要么局限于简单的手工几何关系。我们在本文中引入DHCN:一种利用包括几何与语义关系在内的多源上下文的新型深度分层上下文网络。所提方法基于混合保真项、上下文准则与正则化项的客观函数最小化。该客观函数的解定义了一个双层分层上下文网络的架构;网络第一层捕捉场景几何,第二层对应语义关系。我们通过训练其底层深度网络来求解此表示学习问题,该网络参数对应于最具影响的双层上下文关系,并在具有挑战性的ImageCLEF基准上评估其在图像标注上的性能。

关键词

引用

@article{arxiv.2012.11253,
  title  = {Image Annotation based on Deep Hierarchical Context Networks},
  author = {Mingyuan Jiu and Hichem Sahbi},
  journal= {arXiv preprint arXiv:2012.11253},
  year   = {2020}
}