刷剧式学习:从情景喜剧中扩展可供性学习
计算机视觉与模式识别
2018-04-10 v1
摘要
近年来,联合建模感知与动作的研究兴趣再度兴起。该探究的核心在于建模可供性(affordances 指场景中交互的机会,换言之,表示物体可用于哪些动作)。然而,在预测可供性时,即便最先进的方案仍不使用任何卷积网络(ConvNets)。这是为何?与语义或三维任务不同,目前仍不存在任何大规模的可供性数据集。本文中,我们应对构建最大可供性学习数据集之一的挑战。我们使用七部情景喜剧提取多样化的场景集合,以及演员在场景中如何与不同物体交互。我们的数据集包含超过 1 万个场景和 2.8 万种人类与这些图像交互的方式。我们还提出了一种两步法来预测新场景中的可供性。第一步,给定场景中的一个位置,我们分类 30 个姿态类别中哪一个是可能的可供性姿态。给定姿态类别与场景后,我们使用变分自编码器(VAE)来提取姿态的尺度与形变。VAE 使我们能够在测试时采样可能的姿态分布。最后,我们展示了大规模数据在学习可泛化且鲁棒的可供性模型中的重要性。
引用
@article{arxiv.1804.03080,
title = {Binge Watching: Scaling Affordance Learning from Sitcoms},
author = {Xiaolong Wang and Rohit Girdhar and Abhinav Gupta},
journal= {arXiv preprint arXiv:1804.03080},
year = {2018}
}
备注
CVPR 2017, project page: http://www.cs.cmu.edu/~xiaolonw/affordance.html