中文

从稀疏注视像素图学习显著性预测

计算机视觉与模式识别 2018-09-05 v1

摘要

显著性预测数据集的 ground truth 由两类图数据组成:记录样本图像上人眼运动的注视像素图(fixation pixel map),以及对相应注视像素图进行高斯模糊生成的注视斑图(fixation blob map)。当前显著性方法通过使用注视斑图作为 ground truth,直接将输入图像逐像素回归为显著性图来进行预测,然而从注视像素图学习显著性尚未被探索。在本工作中,我们提出了一种前所未有的从稀疏注视像素图学习显著性预测的方法,以及一种用于从此类稀疏注视中训练的 novel 损失函数。我们利用聚类从原始注视像素图中提取稀疏注视像素,并在输出上添加最大池化变换,以避免在计算损失时由邻近但不重叠的显著性像素引起的稀疏输出与标签之间的错误惩罚。该方法为实现显著性预测提供了新视角。我们在多个基准数据集上评估了我们的方法,并在多项指标上取得了与最先进(state-of-the-art)显著性方法相比具有竞争力的性能。

关键词

引用

@article{arxiv.1809.00644,
  title  = {Learning Saliency Prediction From Sparse Fixation Pixel Map},
  author = {Shanghua Xiao},
  journal= {arXiv preprint arXiv:1809.00644},
  year   = {2018}
}

备注

7 pages, 7 figures