中文

以手法操控世界

计算机视觉与模式识别 2024-08-15 v1

摘要

人类自然地构建物体交互与动力学的心理模型,从而能够想象在采取某种行动后周围环境将如何变化。尽管当前的生成模型在无条件生成或编辑图像以及基于文本条件生成方面已展现出令人印象深刻的结果,但现有方法尚不具备基于动作进行物体操控的能力,而这是世界建模与动作规划的重要工具。因此,我们提出通过学习人类双手与物体交互的无标注视频来学习动作条件生成模型。互联网上此类数据的庞大规模使得高效扩展成为可能,从而实现高性能的动作条件模型。给定一张图像以及期望的手部交互的形状和位置,CosHand 会在交互发生后合成一张未来图像。实验表明,所得到的模型能够很好地预测手-物交互的效果,在未见物体和未见环境中的平移、拉伸和挤压交互方面表现出强大的泛化能力。此外,CosHand 可以多次采样以预测多种可能的效果,从而建模交互/环境中力的不确定性。最后,该方法可泛化到不同的具身,包括非人类的手,即机器人手,这表明生成视频模型可以成为机器人学的强大模型。

关键词

引用

@article{arxiv.2408.07147,
  title  = {Controlling the World by Sleight of Hand},
  author = {Sruthi Sudhakar and Ruoshi Liu and Basile Van Hoorick and Carl Vondrick and Richard Zemel},
  journal= {arXiv preprint arXiv:2408.07147},
  year   = {2024}
}