中文

EML-NET:一种用于显著性预测的可扩展多层网络

计算机视觉与模式识别 2019-03-12 v2

摘要

显著性预测可以受益于涉及场景理解的训练,这些理解可能与中心任务相切;这可能包括理解场景、空间布局、物体,或涉及不同的数据集及其偏差。人们可以组合模型,但以复杂的方式这样做可能很复杂,并且会导致网络臃肿或产生难以平衡的竞争目标。在本文中,我们提出了一个可扩展的系统,利用多个强大的深度 CNN 模型来更好地提取显著性预测的视觉特征。我们的设计与以往研究不同之处在于,整个系统以几乎端到端的分段方式进行训练。编码器和解码器组件分别训练,以应对与计算范式和所需空间相关的复杂性。此外,编码器可以包含多个 CNN 模型来提取特征,并且模型可以具有不同的架构或在不同数据集上预训练。这种并行设计产生了一种更好的计算范式,克服了在编码器阶段可以组合的信息或推理种类的限制,从而实现更深的网络和更强大的编码。我们的网络几乎可以在没有任何额外成本的情况下轻松扩展,并且可以纳入其他预训练的 CNN 模型以利用更广泛的视觉知识。我们将我们的可扩展多层网络称为 EML-NET,并且我们的方法在公开的显著性基准 SALICON、MIT300 和 CAT2000 上取得了 SOTA 结果。

关键词

引用

@article{arxiv.1805.01047,
  title  = {EML-NET:An Expandable Multi-Layer NETwork for Saliency Prediction},
  author = {Sen Jia and Neil D. B. Bruce},
  journal= {arXiv preprint arXiv:1805.01047},
  year   = {2019}
}