从视频中学习基于 grounding 的人-物交互热点
计算机视觉与模式识别
2019-04-04 v2
摘要
学习如何与物体交互是迈向具身视觉智能的重要一步,但现有技术受限于繁重的监督或感知需求。我们提出一种直接从视频中学习人-物交互“热点”的方法。我们的方法不将可供性视为手动监督的语义分割任务,而是通过观看真实人类行为视频并预测可 afforded 的动作来学习交互。给定新颖图像或视频,我们的模型推断空间热点图,指示物体在潜在交互中如何被操控——即使物体当前处于静止状态。通过第一人称和第三人称视频的结果,我们展示了将可供性 grounding 于真实人-物交互中的价值。我们的弱监督热点不仅与强监督可供性方法具有竞争力,而且还能对新颖物体类别预测物体交互。
引用
@article{arxiv.1812.04558,
title = {Grounded Human-Object Interaction Hotspots from Video},
author = {Tushar Nagarajan and Christoph Feichtenhofer and Kristen Grauman},
journal= {arXiv preprint arXiv:1812.04558},
year = {2019}
}