缩放更佳以视更清:基于分层自动缩放网络的人体与物体解析
计算机视觉与模式识别
2016-03-30 v5 机器学习
摘要
将铰接物体(例如人和动物)从自然图像中解析为语义部件(例如身体、头部和手臂等)是计算机视觉中一个具有挑战性且基础的问题。一大困难是物体及其对应部件的尺度和位置具有高度变异性。即便在估计尺度和位置时出现有限错误,也会降低解析输出并导致边界细节错误。为应对这些困难,我们提出了一种用于物体部件解析的“分层自动缩放网络”(Hierarchical Auto-Zoom Net, HAZN),其适应物体及部件的局部尺度。HAZN 由两个“自动缩放网络”(Auto-Zoom Net, AZN)序列构成,每个网络采用全卷积网络执行两项任务:(1) 预测物体实例(第一个 AZN)或其部件(第二个 AZN)的位置与尺度;(2) 估计预测物体实例或部件区域的部件分数。我们的模型能自适应地“缩放”(resize)预测图像区域至恰当尺度以精炼解析。我们在 PASCAL part 数据集上针对人、马和牛进行了大量实验。对于人,我们的方法以 5% mIOU 显著优于当前最优(state-of-the-art)方法,且尤其擅长分割小实例与小部件。对于牛和马的解析,相较于其他方法我们也取得了类似提升。总之,我们先缩放至物体再缩放至部件的策略非常有效。它还使我们能够以不同尺度自适应地处理图像不同区域,从而例如无需浪费计算资源缩放整幅图像。
引用
@article{arxiv.1511.06881,
title = {Zoom Better to See Clearer: Human and Object Parsing with Hierarchical Auto-Zoom Net},
author = {Fangting Xia and Peng Wang and Liang-Chieh Chen and Alan L. Yuille},
journal= {arXiv preprint arXiv:1511.06881},
year = {2016}
}
备注
A shortened version has been submitted to ECCV 2016