利用多模态生成模型学习直觉物理
机器学习
2021-01-21 v2 人工智能
摘要
预测物体与环境接触时的未来交互对于自主智能体采取智能且前瞻性的行动至关重要。本文提出一种融合视觉与触觉反馈的感知框架,用于预测动态场景中物体的预期运动。视觉信息捕获物体的3D形状和位置等属性,而触觉信息提供物体与环境接触时交互力和由此产生的物体运动的关键线索。利用一种新颖的See-Through-your-Skin(STS)传感器提供接触表面的高分辨率多模态感知,我们的系统同时捕获物体的视觉外观和触觉属性。我们使用多模态变分自编码器(MVAE)解释来自传感器的双流信号,使我们能够捕获接触物体的两种模态,并建立从视觉到触觉交互及反向的映射。此外,该感知系统可用于推断未来物理交互的结果,我们通过模拟和真实世界实验验证了这一点,其中从给定初始条件预测物体的静止状态。
引用
@article{arxiv.2101.04454,
title = {Learning Intuitive Physics with Multimodal Generative Models},
author = {Sahand Rezaei-Shoshtari and Francois Robert Hogan and Michael Jenkin and David Meger and Gregory Dudek},
journal= {arXiv preprint arXiv:2101.04454},
year = {2021}
}
备注
AAAI 2021