中文

用于视觉显著性预测的扩张Inception网络

计算机视觉与模式识别 2019-05-10 v2

摘要

近来,随着深度卷积神经网络(DCNN)的出现,视觉显著性预测研究的进展令人瞩目。实现下一突破的一个可能方向,是在DCNN架构中以计算友好模块充分刻画多尺度显著性影响因素。本文提出一种端到端扩张Inception网络(DINet)用于视觉显著性预测。它以极少的额外参数有效捕获多尺度上下文特征。与现有Inception模块使用不同核尺寸的并行标准卷积不同,我们提出的扩张Inception模块(DIM)采用不同膨胀率的并行扩张卷积,在大幅降低计算负担的同时丰富了特征图感受野的多样性。此外,使用一组基于线性归一化的概率分布距离度量作为损失函数,进一步提升了显著性模型性能。由此,我们将显著性预测表述为面向全局显著性推断的概率分布预测任务,而非典型的逐像素回归问题。在多个具挑战性的显著性基准数据集上的实验结果表明,采用所提损失函数的DINet能以更短推理时间取得SOTA性能。

关键词

引用

@article{arxiv.1904.03571,
  title  = {A Dilated Inception Network for Visual Saliency Prediction},
  author = {Sheng Yang and Guosheng Lin and Qiuping Jiang and Weisi Lin},
  journal= {arXiv preprint arXiv:1904.03571},
  year   = {2019}
}

备注

Accepted by IEEE Transactions on Multimedia. The source codes are available at https://github.com/ysyscool/DINet