将人置于场景中:在三维室内环境中学习可供性
计算机视觉与模式识别
2019-03-19 v2
摘要
可供性(Affordance)建模在视觉理解中起着重要作用。本文中,我们旨在预测三维室内场景的可供性,具体而言即给定室内环境可提供何种人体姿态,例如坐在椅子上或站在地板上。为预测有效可供性并学习室内场景中可能的人体三维姿态,我们需要理解场景的语义与几何结构及其与人的潜在交互。为学习此类模型,需要大规模的三维室内可供性数据集。本工作中,我们构建了一个全自动三维姿态合成器,其融合了从电视剧中提取的大量二维姿态的语义知识以及来自室内场景体素表示的三维几何知识。利用该合成器所创建的数据,我们引入了一种三维姿态生成模型,以在给定场景(以单张RGB、RGB-D或深度图像给出)内预测语义合理且物理可行的人体姿态。我们证明,我们的人体可供性预测方法持续优于现有最先进方法。
引用
@article{arxiv.1903.05690,
title = {Putting Humans in a Scene: Learning Affordance in 3D Indoor Environments},
author = {Xueting Li and Sifei Liu and Kihwan Kim and Xiaolong Wang and Ming-Hsuan Yang and Jan Kautz},
journal= {arXiv preprint arXiv:1903.05690},
year = {2019}
}
备注
https://sites.google.com/view/3d-affordance-cvpr19