中文

面向审美感知建模的深度表征工程化

计算机视觉与模式识别 2019-08-09 v2

摘要

计算机视觉中的许多美学模型存在两个缺陷:1)手工设计的美学准则描述性和可解释性低(即无法指示区域级美学),2)难以针对不同图像集自适应、自动地工程化美学特征。为解决这些问题,我们构建了一种深度架构,从Flickr中学习与美学相关的视觉属性,这些属性在弱监督设置下由多个文本属性进行定位。具体而言,利用频繁出现的Flickr图像标签的词袋(BoW)表示,一个稀疏约束的子空间算法为每张图像发现一组紧凑的文本属性(例如,风景和日落)。然后,一个弱监督学习算法将图像级的文本属性投影到像素级的高响应图像块上。这些图像块指示了人类在每种文本属性下注视的具有吸引力的区域,并被用于学习视觉属性。心理学和解剖学研究表明,人类对视觉概念的感知是分层的。因此,我们对这些图像块进行归一化,并将其输入一个五层卷积神经网络(CNN),以模拟人类感知视觉属性的层级结构。我们将学习到的深度特征应用于图像重定向、美学排序和检索。主观和客观的实验结果充分证明了我们方法的竞争力。

关键词

引用

@article{arxiv.1605.07699,
  title  = {Engineering Deep Representations for Modeling Aesthetic Perception},
  author = {Yanxiang Chen and Yuxing Hu and Luming Zhang and Ping Li and Chao Zhang},
  journal= {arXiv preprint arXiv:1605.07699},
  year   = {2019}
}