用于单图像人体动作解析的表达性深度模型
计算机视觉与模式识别
2015-02-03 v1
摘要
本文旨在解决视觉与多媒体研究中一项新兴任务:从静态图像中识别人体动作。其主要挑战在于人体姿态和外观的巨大变化,以及时间运动信息的缺乏。针对这些问题,我们提出开发一种表达性深度模型,以自然地融合人体布局和周围环境上下文,从而实现从静态图像中进行更高层级的动作理解。具体而言,我们训练了一个深度信念网络(Deep Belief Net, DBN)来融合来自不同噪声源的信息,如身体部位检测和物体检测。为了弥合语义鸿沟,我们利用人工标注数据大幅提高了 DBN 训练过程中预训练和微调阶段的有效性与效率。结果表明,该框架对有时不可靠的输入(例如人体部位和物体的不精确检测)具有鲁棒性,且性能优于最先进(state-of-the-art)的方法。
引用
@article{arxiv.1502.00501,
title = {An Expressive Deep Model for Human Action Parsing from A Single Image},
author = {Zhujin Liang and Xiaolong Wang and Rui Huang and Liang Lin},
journal= {arXiv preprint arXiv:1502.00501},
year = {2015}
}
备注
6 pages, 8 figures, ICME 2014