中文

基于CNN图像表示的视觉语言建模

计算机视觉与模式识别 2015-11-11 v1 人工智能 机器学习

摘要

测量图像的自然度对于生成逼真图像或检测图像中非自然区域十分重要。此外,测量自然度的方法可作为基于卷积神经网络(CNN)特征的补充,已知后者对图像自然度不敏感。然而,大多数概率图像模型直接构建在原始图像像素上,建模我们所感知的复杂而抽象的自然度能力有限。本工作中,我们假设自然度可由眼动过程中高层特征的可预测性来度量。基于此假设,我们提出一种新方法,通过在预训练CNN表示上构建循环神经网络语言模型的变体来评估自然度。我们的方法应用于两项任务,表明:1)将我们的方法用作正则化器,能使我们从图像特征生成比现有方法更易理解的图像;2)我们的方法产生的非自然度图在两个被广泛研究的数据集上取得了最先进的眼注视预测性能。

关键词

引用

@article{arxiv.1511.02872,
  title  = {Visual Language Modeling on CNN Image Representations},
  author = {Hiroharu Kato and Tatsuya Harada},
  journal= {arXiv preprint arXiv:1511.02872},
  year   = {2015}
}