梳理深度显著性预测架构
计算机视觉与模式识别
2020-03-12 v1
摘要
学习视觉注意(显著性估计)的计算模型是为了使机器/机器人更接近人类视觉认知能力。自深度神经网络架构引入以来,数据驱动的努力已主导该领域。在深度学习研究中,架构设计的选择常凭经验,且频繁导致模型比所需更为复杂。这种复杂性进而阻碍了应用需求。本文中,我们辨识出显著性模型的四个关键组件,即输入特征、多级整合、读出架构和损失函数。我们回顾现有最先进模型在这四个组件上的表现,并提出新颖且更简单的替代方案。据此,我们提出两种名为SimpleNet和MDNSal的新颖端到端架构,它们更简洁、极简、更具可解释性,并在公开显著性基准上达到最先进性能。SimpleNet是一种优化后的编码器-解码器架构,在SALICON数据集(最大显著性基准)上带来显著性能提升。MDNSal是一种参数化模型,直接预测GMM分布的参数,旨在为预测图带来更多可解释性。所提显著性模型可以25fps推断,适用于实时应用。代码与预训练模型见https://github.com/samyak0210/saliency。
引用
@article{arxiv.2003.04942,
title = {Tidying Deep Saliency Prediction Architectures},
author = {Navyasri Reddy and Samyak Jain and Pradeep Yarlagadda and Vineet Gandhi},
journal= {arXiv preprint arXiv:2003.04942},
year = {2020}
}