中文

用于视觉显著性预测的上下文编码器-解码器网络

计算机视觉与模式识别 2024-04-08 v4

摘要

预测自然图像中的显著区域需要检测场景中存在的物体。为应对这一挑战性任务建立鲁棒表征,必须提取多空间尺度的高层视觉特征,并用上下文信息加以增强。然而,现有旨在解释人类注视图的模型并未显式地引入此类机制。本文提出一种基于在大规模图像分类任务上预训练的卷积神经网络的方法。该架构形成编码器-解码器结构,并包含一个具有不同膨胀率的多卷积层模块,以并行捕获多尺度特征。此外,我们将所得表征与全局场景信息相结合,以精确预测视觉显著性。我们的模型在两个公开显著性基准的多个评价指标上取得了具有竞争力且一致的结果,并在五个数据集和选定样本上证明了所提方法的有效性。与最先进的方法相比,该网络基于轻量级图像分类骨干网络,因此适用于计算资源受限的应用,例如(虚拟)机器人系统,以估计复杂自然场景中的人类注视。

关键词

引用

@article{arxiv.1902.06634,
  title  = {Contextual Encoder-Decoder Network for Visual Saliency Prediction},
  author = {Alexander Kroner and Mario Senden and Kurt Driessens and Rainer Goebel},
  journal= {arXiv preprint arXiv:1902.06634},
  year   = {2024}
}

备注

Updated contact information