理解以人为中心的图像:从几何到时尚
计算机视觉与模式识别
2016-04-28 v1
摘要
从照片中理解人类一直是计算机视觉的基本目标。在本论文中,我们开发了一套层次化工具,涵盖广泛的主题,目标是从单目 RGB 图像理解人类:从低级特征点描述子到高级时尚感知条件随机场模型。为了构建这些高级模型,拥有一系列鲁棒可靠的低中级线索至关重要。沿着这些思路,我们提出了两种低级关键点描述子:一种基于图像热扩散理论,另一种使用卷积神经网络学习有判别力的图像块表示。我们还引入了不同的低级生成模型来表示人体姿态:特别地,我们提出了一种基于有向无环图的离散模型,以及一种由聚集在黎曼流形上的姿态组成的连续模型。作为中级线索,我们提出了两种三维人体姿态估计算法:一种在给定含噪二维估计下估计三维姿态,另一种同时估计二维和三维姿态。最后,我们基于低级和中级线索构建了高级模型,用于从单张图像理解人类。具体而言,我们关注时尚背景下的两个不同任务:服装语义分割,以及从带有元数据的图像预测时尚度,最终为用户提供时尚建议。对于所有提出的方法,我们给出了广泛的结果并与最先进水平进行比较,显示出在我们处理的全部各类任务上的显著改进。
引用
@article{arxiv.1604.08164,
title = {Understanding Human-Centric Images: From Geometry to Fashion},
author = {Edgar Simo-Serra},
journal= {arXiv preprint arXiv:1604.08164},
year = {2016}
}
备注
PhD Thesis, May 2015. BarcelonaTech. 169 pages