基于视频的具身人与物体交互热点图(扩展摘要)
计算机视觉与模式识别
2019-06-06 v1
摘要
学习如何与物体交互是迈向具身视觉智能的重要一步,但现有技术受限于繁重的监督或感知需求。我们提出一种直接从视频中学习人与物体交互“热点(hotspots)”的方法。我们的方法不将功能可供性(affordance)视为人工监督的语义分割任务,而是通过观看真实人类行为视频并预测可 afforded 的动作来学习交互。给定新图像或视频,我们的模型推断出一个空间热点图,指示物体在潜在交互中如何被操控,即使该物体当前处于静止状态。通过第一人称与第三人称视频的结果,我们展示了将可供性扎根于真实人与物体交互中的价值。我们的弱监督热点图不仅与强监督可供性方法具有竞争力,还能对新颖物体类别预测物体交互。项目页面:http://vision.cs.utexas.edu/projects/interaction-hotspots/
引用
@article{arxiv.1906.01963,
title = {Grounded Human-Object Interaction Hotspots from Video (Extended Abstract)},
author = {Tushar Nagarajan and Christoph Feichtenhofer and Kristen Grauman},
journal= {arXiv preprint arXiv:1906.01963},
year = {2019}
}
备注
arXiv admin note: substantial text overlap with arXiv:1812.04558